PANDUAN AI Visual

Penguraian Token Paralel MaskGIT

MaskGIT menghasilkan gambar dengan memprediksi banyak token sekaligus dan mengisi yang paling percaya diri terlebih dahulu, menggantikan pembuatan lambat dari kiri ke kanan dengan beberapa langkah paralel yang cepat.

2 min readTerakhir diperbarui

Menyelam Lebih Dalam

MaskGIT (Masked Generative Image Transformer), dari Google pada tahun 2022, memikirkan kembali cara model gambar berbasis token memecahkan kode. Transformator sebelumnya seperti VQGAN menghasilkan token secara otomatis, satu per satu dalam urutan raster, yang lambat dan tidak wajar untuk gambar 2D. MaskGIT malah berlatih dengan tujuan pemodelan bertopeng seperti BERT: subset acak dari token gambar disembunyikan dan model belajar memprediksi semuanya secara bersamaan menggunakan perhatian dua arah. Pada waktu pembangkitan, ini dimulai dari grid yang sepenuhnya tertutup dan diterjemahkan dalam jumlah iterasi yang tetap (seringkali 8 hingga 12). Setiap langkahnya memprediksi setiap token yang disamarkan, menyimpan prediksi dengan tingkat keyakinan tertinggi, dan menutupi kembali sisanya untuk putaran berikutnya. Ini menghasilkan gambar berkualitas tinggi dalam urutan langkah yang lebih sedikit dibandingkan decoding autoregresif.

Wawasan Teknis

Komponen krusialnya adalah jadwal penggunaan masker berbasis kepercayaan diri. Jadwal kosinus menentukan berapa banyak token yang akan ditampilkan setiap iterasi, dimulai dengan lambat dan dipercepat. Karena perhatian bersifat dua arah, setiap token melihat keseluruhan gambar parsial, jadi dengan melakukan prediksi yang paling pasti terlebih dahulu, langkah-langkah selanjutnya akan dikondisikan pada konteks yang solid, seperti memecahkan bagian mudah dari sebuah teka-teki sebelum bagian yang ambigu.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Decoding Token Paralel MaskGIT

Penguraian kode berulang MaskGIT menginspirasi gelombang generator non-autoregresif, termasuk MUSE untuk teks-ke-gambar dan pendekatan bertopeng untuk video. Polanya, yang memprediksi token secara paralel dan menyempurnakannya dalam beberapa langkah, berada di antara GAN sekali pakai dan difusi banyak langkah, sehingga menawarkan pertukaran kualitas dan kecepatan yang dapat disesuaikan. Harapkan decoding token bertopeng untuk terus muncul di generator multimoda cepat dan sistem pengeditan di mana pengecatan dan pengisian bersyarat merupakan hal yang wajar.

Implementasi Dunia Nyata

Menghasilkan gambar penuh dalam sekitar 8 hingga 12 langkah paralel, bukan ratusan prediksi token autoregresif

Melukis bagian foto yang bertopeng dengan hanya memprediksi ulang token tersembunyi dengan konteks sekitarnya

Sintesis gambar bersyarat kelas di ImageNet dengan kualitas bersaing dengan model yang jauh lebih lambat

Berfungsi sebagai tulang punggung decoding untuk sistem teks-ke-gambar seperti MUSE Google yang memerlukan pembuatan cepat

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Decoding Paralel Kerangka Pemikiran

Pertanyaan yang sering diajukan

What is MaskGIT Parallel Token Decoding?

MaskGIT menghasilkan gambar dengan memprediksi banyak token sekaligus dan mengisi yang paling percaya diri terlebih dahulu, menggantikan pembuatan lambat dari kiri ke kanan dengan beberapa langkah paralel yang cepat.

Bagaimana cara MaskGIT mendekode token gambar secara berbeda dari transformator VQGAN?

MaskGIT memprediksi semua token yang disamarkan secara bersamaan dengan perhatian dua arah, tidak seperti decoding autoregresif kiri-ke-kanan yang lambat dari VQGAN.

Tujuan pelatihan apa yang dipinjam MaskGIT dari model bahasa?

MaskGIT menyembunyikan subset token secara acak dan belajar memprediksinya, sebuah tujuan pemodelan bertopeng yang mirip dengan BERT.

Selama pembuatan, token manakah yang dikomit MaskGIT pada setiap iterasi?

Setiap langkah menyimpan prediksi yang paling meyakinkan dan menutupi kembali sisanya, sehingga langkah selanjutnya bergantung pada konteks yang dapat diandalkan.

Kira-kira berapa banyak iterasi yang biasanya dibutuhkan MaskGIT untuk menghasilkan gambar?

MaskGIT menerjemahkan kode dalam sejumlah kecil langkah, seringkali 8 hingga 12, jauh lebih sedikit dibandingkan pendekatan autoregresif atau difusi.

Jadwal apa yang mengontrol berapa banyak token yang diungkapkan MaskGIT di setiap langkah?

Jadwal kosinus mengungkapkan beberapa token lebih awal dan lebih lambat, menyeimbangkan kualitas dan kecepatan di seluruh iterasi.