Pengubah Penglihatan
Pengubah Penglihatan (ViTs) menggunakan seni bina pengubah yang memberi kuasa ChatGPT pada imej, menganggap gambar sebagai urutan tampalan dan bukannya grid piksel.
Gambaran keseluruhan
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Menyelam dalam
Selama bertahun-tahun, rangkaian neural convolutional (CNN) menguasai penglihatan komputer dengan mengimbas penapis kecil merentasi imej. Makalah 2020 'An Image Is Worth 16x16 Words' daripada Google mencabar perkara ini dengan memotong imej menjadi tompok tetap, biasanya 16x16 piksel, meratakan setiap satu menjadi vektor dan memasukkan jujukan yang terhasil ke dalam pengubah standard. Setiap tampalan menjadi 'token,' sama seperti perkataan dalam ayat. Model itu kemudiannya menggunakan perhatian kendiri supaya setiap tampung boleh berhubung terus dengan setiap tampung lain, menangkap hubungan jarak jauh yang tidak dapat dilihat oleh penapis konvolusi kecil dalam satu langkah. Tangkapan: ViT kemaruk data kerana mereka tidak mempunyai andaian terbina dalam CNN. Dilatih pada set data yang besar seperti JFT-300M, mereka memadankan atau mengalahkan CNN terbaik, membentuk semula penyelidikan penglihatan moden.
Wawasan Teknikal
ViT membahagikan imej kepada tampalan tidak bertindih, menayangkan setiap tampalan secara linear ke dalam pembenaman dan menambah pengekodan kedudukan supaya model mengetahui di mana setiap tampalan terletak dalam imej asal. 'Token kelas' khas yang boleh dipelajari disediakan; perwakilan terakhirnya memacu klasifikasi. Lapisan perhatian diri yang disusun membolehkan setiap tampung menimbang maklumat daripada semua yang lain, memberikan medan penerimaan global dari lapisan satu. Oleh kerana perhatian berskala kuadratik dengan bilangan tampalan, imej resolusi tinggi menjadi mahal, itulah sebabnya saiz tampung dan varian perhatian yang cekap penting.
Kesan Strategik
Kelajuan dan skala
Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.
Pilihan binaan
Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.
Pasukan dan aliran kerja
Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.
Masa Depan Pengubah Penglihatan
Hibrid ViT dan CNN-transformer kini menguasai sistem penglihatan terkemuka, dan seni bina menyokong model multimodal yang menggabungkan imej dengan teks, seperti CLIP dan pembantu bahasa penglihatan moden. Jangkakan usaha berterusan untuk menjadikan perhatian lebih murah untuk resolusi tinggi dan video, serta pralatihan diselia sendiri (seperti pemodelan imej bertopeng) yang mengurangkan selera data berlabel yang besar. Apabila pengiraan berkembang, garis antara 'model bahasa' dan 'model penglihatan' terus kabur, dengan transformer berfungsi sebagai tulang belakang yang dikongsi merentas modaliti dan bukannya reka bentuk khusus yang berasingan.
Pelaksanaan Dunia Sebenar
Klasifikasi imej dan sistem kedudukan carian Google yang menggunakan tulang belakang pengubah selepas ViT terbukti berdaya saing dengan CNN
CLIP dan model teks imej lain yang menggunakan ViT untuk mengekod imej supaya foto dan kapsyen boleh dipadankan dalam ruang kongsi
Penyelidikan pengimejan perubatan menggunakan ViT untuk mengesan corak pada keseluruhan imbasan dan bukannya tekstur tempatan sahaja
Timbunan persepsi pemanduan sendiri dan robotik yang menggabungkan perhatian gaya ViT untuk pemahaman adegan merentas bidang pandangan penuh
Risiko & Pengawal
Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.
Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.
Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.
Hala Tuju Pelaksanaan
Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.
Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.
Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.
Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Model CLIP dan Visi-Bahasa
Soalan lazim
What is Vision Transformers?
Pengubah Penglihatan (ViTs) menggunakan seni bina pengubah yang memberi kuasa ChatGPT pada imej, menganggap gambar sebagai urutan tampalan dan bukannya grid piksel. Mereka membuktikan bahawa anda tidak memerlukan konvolusi untuk mencapai pengecaman imej yang terkini.
Bagaimanakah Transformer Penglihatan pada mulanya memproses imej input?
ViT membahagikan imej kepada tompok tetap (selalunya 16x16 piksel), membenamkan setiap tampalan sebagai token dan menyuapkan jujukan ke dalam pengubah.
Apakah mekanisme utama yang membolehkan ViT mengaitkan bahagian jauh imej antara satu sama lain?
Perhatian kendiri membolehkan setiap tampalan menimbang secara langsung maklumat daripada setiap tampalan lain, memberikan pandangan global dari lapisan pertama.
Mengapakah Transformers Visi biasa biasanya memerlukan set data latihan yang sangat besar untuk cemerlang?
Tidak seperti CNN, ViT tidak menganggap lokaliti atau invarian terjemahan, jadi mereka mesti mempelajari corak ini daripada sejumlah besar data.
Apakah tujuan pengekodan kedudukan dalam Transformer Penglihatan?
Perhatian diri adalah agnostik tertib, jadi pengekodan kedudukan memulihkan lokasi spatial setiap tampung.
Pernyataan manakah yang paling menggambarkan kesan ViT terhadap penglihatan komputer?
ViT menunjukkan bahawa pengubah tulen, dengan data dan skala yang mencukupi, boleh menyaingi atau mengatasi rangkaian konvolusi terbaik.