PANDUAN AI Visual

Penyahkodan Token Selari MaskGIT

MaskGIT menjana imej dengan meramalkan banyak token sekaligus dan mengisi yang paling yakin dahulu, menggantikan generasi kiri ke kanan yang perlahan dengan beberapa langkah selari pantas.

2 min dibacaKemas kini terakhir

Menyelam dalam

MaskGIT (Masked Generative Image Transformer), daripada Google pada tahun 2022, memikirkan semula cara model imej berasaskan token menyahkod. Transformer terdahulu seperti VQGAN menjana token secara autoregresif, satu demi satu dalam susunan raster, yang perlahan dan tidak semulajadi untuk imej 2D. MaskGIT sebaliknya berlatih dengan objektif pemodelan bertopeng seperti BERT: subset rawak token imej disembunyikan dan model belajar untuk meramalkan kesemuanya secara serentak menggunakan perhatian dua arah. Pada masa penjanaan ia bermula daripada grid bertopeng sepenuhnya dan menyahkod dalam bilangan lelaran tetap (selalunya 8 hingga 12). Setiap langkah ia meramalkan setiap token bertopeng, menyimpan ramalan keyakinan tertinggi dan menutup semula yang lain untuk pusingan seterusnya. Ini menghasilkan imej berkualiti tinggi dalam kira-kira urutan magnitud yang lebih sedikit daripada penyahkodan autoregresif.

Wawasan Teknikal

Komponen penting ialah jadual topeng berasaskan keyakinan. Jadual kosinus menentukan bilangan token untuk mendedahkan setiap lelaran, bermula perlahan dan memecut. Oleh kerana perhatian adalah dwiarah, setiap token melihat keseluruhan imej separa, jadi melakukan ramalan yang paling yakin terlebih dahulu membolehkan langkah kemudiannya mengikut konteks yang kukuh, sama seperti menyelesaikan bahagian mudah teka-teki sebelum yang samar-samar.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan Penyahkodan Token Selari MaskGIT

Penyahkodan lelaran selari MaskGIT mengilhamkan gelombang penjana bukan autoregresif, termasuk MUSE untuk pendekatan teks-ke-imej dan bertopeng untuk video. Corak, meramalkan token secara selari dan memperhalusi dalam beberapa langkah, terletak di antara GAN satu pukulan dan resapan banyak langkah, menawarkan pertukaran kelajuan kualiti yang boleh dilaras. Jangkakan penyahkodan token bertopeng untuk terus muncul dalam penjana multimodal pantas dan sistem penyuntingan di mana pengecatan dalam dan isian bersyarat adalah padan semula jadi.

Pelaksanaan Dunia Sebenar

Menjana imej penuh dalam kira-kira 8 hingga 12 langkah selari dan bukannya ratusan ramalan token autoregresif

Melukis kawasan bertopeng pada foto dengan meramalkan semula hanya token tersembunyi dengan konteks sekeliling

Sintesis imej bersyarat kelas pada ImageNet pada kualiti yang kompetitif dengan model yang lebih perlahan

Berkhidmat sebagai tulang belakang penyahkodan untuk sistem teks ke imej seperti MUSE Google yang memerlukan penjanaan pantas

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Penyahkodan Selari Rangka Pemikiran

Soalan lazim

What is MaskGIT Parallel Token Decoding?

MaskGIT menjana imej dengan meramalkan banyak token sekaligus dan mengisi yang paling yakin dahulu, menggantikan generasi kiri ke kanan yang perlahan dengan beberapa langkah selari pantas.

Bagaimanakah MaskGIT menyahkod token imej secara berbeza daripada pengubah VQGAN?

MaskGIT meramalkan semua token bertopeng secara serentak dengan perhatian dwiarah, tidak seperti penyahkodan autoregresif kiri ke kanan VQGAN yang perlahan.

Apakah objektif latihan yang dipinjam oleh MaskGIT daripada model bahasa?

MaskGIT menyembunyikan subset rawak token dan belajar meramalkannya, objektif pemodelan bertopeng serupa dengan BERT.

Semasa penjanaan, token manakah yang MaskGIT lakukan pada setiap lelaran?

Setiap langkah mengekalkan ramalan yang paling yakin dan menutup semula yang lain, jadi langkah kemudiannya mengikut konteks yang boleh dipercayai.

Kira-kira berapa banyak lelaran yang biasanya diperlukan oleh MaskGIT untuk menghasilkan imej?

MaskGIT menyahkod dalam bilangan langkah tetap yang kecil, selalunya 8 hingga 12, jauh lebih sedikit daripada pendekatan autoregresif atau resapan.

Jadual apakah yang mengawal bilangan token yang MaskGIT dedahkan setiap langkah?

Jadual kosinus mendedahkan beberapa token lebih awal dan lebih kemudian, mengimbangi kualiti dan kelajuan merentas lelaran.