PANDUAN AI Visual

Konvolusi yang Dapat Dideformasi

Konvolusi yang dapat dideformasi memungkinkan jaringan saraf membengkokkan kisi pengambilan sampelnya untuk mengikuti bentuk objek sebenarnya, alih-alih memaksanya melewati jendela persegi yang kaku.

2 min readTerakhir diperbarui

Ikhtisar

This makes models far better at handling odd shapes, scale changes, and geometric distortion.

Menyelam Lebih Dalam

Konvolusi normal mengambil sampel piksel pada offset tetap — kisi 3x3 rapi yang berpusat di setiap lokasi. Itu berfungsi dengan baik untuk tekstur tetapi kesulitan ketika objek dimiringkan, diregangkan, atau berbentuk aneh. Konvolusi yang dapat dideformasi, yang diperkenalkan oleh Dai dan rekannya di Microsoft Research pada tahun 2017, menambahkan sedikit pembelajaran offset ke setiap titik pengambilan sampel tersebut. Jaringan melihat masukan dan memprediksi pergeseran 2D untuk setiap posisi grid, sehingga bidang reseptif dapat melengkung hingga mendekati tepi melengkung atau mengikuti bagian miring. Pengumpulan RoI yang dapat diubah menerapkan ide yang sama pada fitur wilayah. Versi 2 (2018) menambahkan bobot modulasi per titik, membiarkan lapisan meredam atau memperkuat setiap sampel, sehingga mempertajam akurasi deteksi objek pada tolok ukur seperti COCO.

Wawasan Teknis

Offset dihasilkan oleh lapisan konvolusi tambahan yang berjalan secara paralel, menghasilkan nilai 2N untuk kernel titik-N (satu dx, satu dy per titik). Karena prediksi offset bersifat pecahan, nilai piksel sampel dihitung dengan interpolasi bilinear, sehingga keseluruhan operasi dapat dibedakan. Offset dipelajari secara end-to-end melalui backpropagation normal — tidak ada pengawasan terpisah yang memberi tahu jaringan di mana mencarinya. Biaya tambahannya tidak terlalu besar karena cabang offset lebih ringan dibandingkan peta fitur utama.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Konvolusi yang Dapat Dideformasi

Perhatian yang dapat dideformasi telah menjadi tulang punggung deteksi modern: DETR yang dapat dideformasi menggunakan offset pengambilan sampel yang dipelajari untuk membuat perhatian transformator menjadi lebih sedikit dan cepat, sehingga memangkas waktu pelatihan secara signifikan dibandingkan DETR asli. Harapkan prinsip deformasi untuk terus menyebar ke video, awan titik 3D, dan model bahasa penglihatan, di mana pengambilan sampel adaptif membantu menangani gerakan, oklusi, dan geometri tidak beraturan. Seiring dengan meningkatnya dukungan perangkat keras untuk akses memori tidak teratur, operator yang dapat dideformasi juga harus lebih murah dan lebih banyak digunakan pada perangkat edge.

Implementasi Dunia Nyata

Deteksi objek di COCO, dengan lapisan yang dapat diubah bentuk meningkatkan akurasi pada objek yang memanjang atau diputar seperti kereta api dan jerapah

Segmentasi semantik pemandangan jalanan, membantu model menelusuri marka jalur yang melengkung dan garis luar bangunan yang tidak beraturan

DETR yang dapat dideformasi untuk deteksi ujung ke ujung, menggunakan offset yang dipelajari untuk membuat perhatian transformator menjadi efisien

Pencitraan medis, dimana tumor dan organ memiliki bentuk yang tidak kaku sehingga jaringan tetap tidak dapat menangkapnya dengan baik

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deformable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Konvolusi yang Dapat Dipisahkan Secara Mendalam

Pertanyaan yang sering diajukan

What is Deformable Convolutions?

Konvolusi yang dapat dideformasi memungkinkan jaringan saraf membengkokkan kisi pengambilan sampelnya untuk mengikuti bentuk objek sebenarnya, alih-alih memaksanya melewati jendela persegi yang kaku. Hal ini membuat model jauh lebih baik dalam menangani bentuk aneh, perubahan skala, dan distorsi geometris.

Apa yang ditambahkan oleh konvolusi yang dapat dideformasi dibandingkan dengan konvolusi standar?

Konvolusi yang dapat dideformasi memprediksi offset yang dipelajari (dx, dy) untuk setiap lokasi pengambilan sampel, sehingga kisi-kisi melengkung agar sesuai dengan bentuk objek.

Bagaimana offset pengambilan sampel dalam konvolusi yang dapat dideformasi dihasilkan?

Cabang konvolusi paralel mengeluarkan offset, yang dipelajari secara end-to-end melalui propagasi mundur.

Karena prediksi offset biasanya bersifat pecahan, bagaimana pengambilan sampel nilai piksel pada posisi tersebut?

Penyeimbangan pecahan memerlukan interpolasi bilinear, yang membuat operasi dapat dibedakan untuk pelatihan.

Apa yang ditambahkan oleh Deformable ConvNets v2 (2018) dibandingkan versi aslinya?

v2 memperkenalkan modulasi, bobot yang dipelajari per titik pengambilan sampel yang dapat memperkuat atau menekan pengaruhnya, sehingga meningkatkan akurasi.

Mengapa konvolusi yang dapat dideformasi sangat berguna untuk benda yang bentuknya tidak beraturan?

Dengan membengkokkan grid pengambilan sampel, bidang reseptif efektif sejajar dengan geometri objek, bukan persegi kaku.