VQ-VAE dan Terpendam Diskret
VQ-VAE memampatkan imej, audio atau video ke dalam grid kecil kod diskret yang diambil daripada buku kod yang dipelajari, bukannya nombor berterusan.
Gambaran keseluruhan
This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.
Menyelam dalam
VQ-VAE (Vector Quantized Variational Autoencoder), yang diperkenalkan oleh van den Oord dan rakan sekerja di DeepMind pada 2017, ialah pengekod auto yang ruang terpendamnya adalah diskret. Pengekod menukar imej menjadi grid vektor berterusan; setiap vektor kemudiannya dipetik ke entri terdekatnya dalam buku kod pembenaman yang dipelajari (pengkuantitian vektor). Penyahkod membina semula imej daripada kod terkuantiti tersebut. Oleh kerana laten kini merupakan perbendaharaan kata terhingga bagi indeks, model yang berasingan boleh mempelajari pengedarannya dan menjana kandungan baharu. Resipi dua peringkat ini menguasakan DALL-E 1, Jukebox untuk muzik dan VQGAN, yang menambah kerugian persepsi dan permusuhan untuk pembinaan semula yang lebih tajam. VQ-VAE-2 menyusun berbilang resolusi untuk menghasilkan imej kesetiaan tinggi.
Wawasan Teknikal
Langkah pengkuantitian (carian jiran terdekat argmin) tidak boleh dibezakan, jadi VQ-VAE menggunakan penganggar lurus: kecerunan disalin terus daripada input penyahkod kembali ke output pengekod seolah-olah pengkuantitian adalah identiti. Latihan menggabungkan kehilangan pembinaan semula, kehilangan buku kod yang menarik benam ke arah output pengekod, dan kehilangan komitmen memastikan pengekod komited kepada kod pilihannya. Kegagalan biasa ialah keruntuhan buku kod, di mana hanya beberapa kod digunakan.
Kesan Strategik
Kelajuan dan skala
Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.
Pilihan binaan
Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.
Pasukan dan aliran kerja
Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.
Masa Depan VQ-VAE dan Terpendam Diskret
Laten diskret adalah teras kepada dorongan ke arah model multimodal bersatu yang menandakan imej, audio dan video ke dalam perbendaharaan kata yang sama seperti teks. Penambahbaikan seperti pengkuantitian skalar sisa dan terhingga, buku kod yang lebih besar dan pengimbangan penggunaan yang lebih baik mengurangkan keruntuhan dan meningkatkan kesetiaan. Memandangkan model bertujuan untuk memahami dan menjana merentas modaliti, tokenizer teguh yang dibina di atas idea VQ-VAE akan kekal sebagai ramuan asas, semakin bersaing dan digabungkan dengan pendekatan penyebaran terpendam yang berterusan.
Pelaksanaan Dunia Sebenar
DALL-E 1 menggunakan tokenizer VQ-VAE diskret supaya Transformer boleh menjana imej sebagai jujukan indeks buku kod.
VQGAN menggabungkan VQ-VAE dengan kehilangan permusuhan dan persepsi untuk menghasilkan token imej beresolusi tinggi yang jelas untuk penjanaan seni.
Jukebox OpenAI menggunakan VQ-VAE pada audio mentah, memampatkan muzik ke dalam kod diskret untuk pemodelan generatif.
VQ-VAE-2 menyusun pendam diskret hierarki untuk mensintesis pelbagai imej kesetiaan tinggi yang menyaingi GAN pada zamannya.
Risiko & Pengawal
Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.
Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.
Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.
Hala Tuju Pelaksanaan
Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.
Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.
Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.
Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQ-VAE and Discrete Latents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Pengadunan Terpendam dan Interpolasi Imej
Soalan lazim
What is VQ-VAE and Discrete Latents?
VQ-VAE memampatkan imej, audio atau video ke dalam grid kecil kod diskret yang diambil daripada buku kod yang dipelajari, bukannya nombor berterusan. Kesesakan diskret ini membolehkan model jujukan yang berkuasa seperti Transformers menganggap media sebagai 'token', sama seperti perkataan.
Apakah yang menjadikan ruang terpendam VQ-VAE berbeza daripada VAE standard?
VQ-VAE menggantikan pendam berterusan dengan kod diskret yang diambil daripada buku kod yang dipelajari melalui pengkuantitian vektor.
Bagaimanakah VQ-VAE melepasi kecerunan melalui langkah pengkuantitian tidak boleh dibezakan?
Penganggar lurus terus menyalin kecerunan input penyahkod terus ke output pengekod, menganggap pengkuantitian sebagai identiti untuk hantaran ke belakang.
Apakah 'keruntuhan buku kod'?
Keruntuhan buku kod berlaku apabila model hanya bergantung pada beberapa kod, membazirkan kebanyakan buku kod dan menjejaskan kepelbagaian.
Mengapakah pendam diskret berguna untuk pemodelan generatif dengan Transformers?
Indeks diskret membentuk perbendaharaan kata terhingga, jadi model jujukan seperti Transformers boleh mempelajari dan mencuba pengedarannya sama seperti perkataan.
Apakah yang ditambahkan oleh VQGAN di atas resipi asas VQ-VAE?
VQGAN menambah VQ-VAE dengan diskriminasi dan kehilangan persepsi, menghasilkan token yang dibina semula yang lebih tajam dan terperinci.