Penyahkodan Token Selari MaskGIT
MaskGIT menjana imej dengan meramalkan banyak token sekaligus dan mengisi yang paling yakin dahulu, menggantikan generasi kiri ke kanan yang perlahan dengan beberapa langkah selari pantas.
Menyelam dalam
MaskGIT (Masked Generative Image Transformer), daripada Google pada tahun 2022, memikirkan semula cara model imej berasaskan token menyahkod. Transformer terdahulu seperti VQGAN menjana token secara autoregresif, satu demi satu dalam susunan raster, yang perlahan dan tidak semulajadi untuk imej 2D. MaskGIT sebaliknya berlatih dengan objektif pemodelan bertopeng seperti BERT: subset rawak token imej disembunyikan dan model belajar untuk meramalkan kesemuanya secara serentak menggunakan perhatian dua arah. Pada masa penjanaan ia bermula daripada grid bertopeng sepenuhnya dan menyahkod dalam bilangan lelaran tetap (selalunya 8 hingga 12). Setiap langkah ia meramalkan setiap token bertopeng, menyimpan ramalan keyakinan tertinggi dan menutup semula yang lain untuk pusingan seterusnya. Ini menghasilkan imej berkualiti tinggi dalam kira-kira urutan magnitud yang lebih sedikit daripada penyahkodan autoregresif.
Wawasan Teknikal
Komponen penting ialah jadual topeng berasaskan keyakinan. Jadual kosinus menentukan bilangan token untuk mendedahkan setiap lelaran, bermula perlahan dan memecut. Oleh kerana perhatian adalah dwiarah, setiap token melihat keseluruhan imej separa, jadi melakukan ramalan yang paling yakin terlebih dahulu membolehkan langkah kemudiannya mengikut konteks yang kukuh, sama seperti menyelesaikan bahagian mudah teka-teki sebelum yang samar-samar.
Kesan Strategik
Kelajuan dan skala
Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.
Pilihan binaan
Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.
Pasukan dan aliran kerja
Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.
Masa Depan Penyahkodan Token Selari MaskGIT
Penyahkodan lelaran selari MaskGIT mengilhamkan gelombang penjana bukan autoregresif, termasuk MUSE untuk pendekatan teks-ke-imej dan bertopeng untuk video. Corak, meramalkan token secara selari dan memperhalusi dalam beberapa langkah, terletak di antara GAN satu pukulan dan resapan banyak langkah, menawarkan pertukaran kelajuan kualiti yang boleh dilaras. Jangkakan penyahkodan token bertopeng untuk terus muncul dalam penjana multimodal pantas dan sistem penyuntingan di mana pengecatan dalam dan isian bersyarat adalah padan semula jadi.
Pelaksanaan Dunia Sebenar
Menjana imej penuh dalam kira-kira 8 hingga 12 langkah selari dan bukannya ratusan ramalan token autoregresif
Melukis kawasan bertopeng pada foto dengan meramalkan semula hanya token tersembunyi dengan konteks sekeliling
Sintesis imej bersyarat kelas pada ImageNet pada kualiti yang kompetitif dengan model yang lebih perlahan
Berkhidmat sebagai tulang belakang penyahkodan untuk sistem teks ke imej seperti MUSE Google yang memerlukan penjanaan pantas
Risiko & Pengawal
Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.
Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.
Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.
Hala Tuju Pelaksanaan
Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.
Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.
Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.
Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MaskGIT Parallel Token Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Penyahkodan Selari Rangka Pemikiran
Soalan lazim
What is MaskGIT Parallel Token Decoding?
MaskGIT menjana imej dengan meramalkan banyak token sekaligus dan mengisi yang paling yakin dahulu, menggantikan generasi kiri ke kanan yang perlahan dengan beberapa langkah selari pantas.
Bagaimanakah MaskGIT menyahkod token imej secara berbeza daripada pengubah VQGAN?
MaskGIT meramalkan semua token bertopeng secara serentak dengan perhatian dwiarah, tidak seperti penyahkodan autoregresif kiri ke kanan VQGAN yang perlahan.
Apakah objektif latihan yang dipinjam oleh MaskGIT daripada model bahasa?
MaskGIT menyembunyikan subset rawak token dan belajar meramalkannya, objektif pemodelan bertopeng serupa dengan BERT.
Semasa penjanaan, token manakah yang MaskGIT lakukan pada setiap lelaran?
Setiap langkah mengekalkan ramalan yang paling yakin dan menutup semula yang lain, jadi langkah kemudiannya mengikut konteks yang boleh dipercayai.
Kira-kira berapa banyak lelaran yang biasanya diperlukan oleh MaskGIT untuk menghasilkan imej?
MaskGIT menyahkod dalam bilangan langkah tetap yang kecil, selalunya 8 hingga 12, jauh lebih sedikit daripada pendekatan autoregresif atau resapan.
Jadual apakah yang mengawal bilangan token yang MaskGIT dedahkan setiap langkah?
Jadual kosinus mendedahkan beberapa token lebih awal dan lebih kemudian, mengimbangi kualiti dan kelajuan merentas lelaran.