PANDUAN AI Visual

VQGAN dan Sintesis Imej Buku Kod

VQGAN memampatkan imej ke dalam grid token diskret yang diambil daripada buku kod yang dipelajari, membenarkan pengubah menjana imej dengan cara yang sama model bahasa menjana teks.

2 min dibacaKemas kini terakhir

Menyelam dalam

VQGAN, yang diperkenalkan dalam makalah 2021 'Taming Transformers for High-Resolution Image Synthesis,' menggabungkan pengekod automatik terkuantiti vektor (VQVAE) dengan latihan permusuhan dan persepsi. Pengekod memetakan imej ke grid kecil vektor ciri; setiap vektor disentap ke entri terdekat dalam buku kod yang dipelajari, katakan, 1024 kod diskret, menjadikan imej itu menjadi jujukan token integer. Penyahkod membina semula imej daripada token tersebut, dilatih dengan diskriminasi GAN dan kehilangan persepsi supaya pembinaan semula kelihatan tajam dan bukannya kabur. Oleh kerana imej kini ialah jujukan token diskret, pengubah autoregresif boleh memodelkannya seperti bahasa, meramalkan token satu demi satu. VQGAN terkenal dikuasakan alat seni teks-ke-imej awal apabila dipasangkan dengan panduan CLIP.

Wawasan Teknikal

Operasi teras ialah pengkuantitian vektor: output pengekod berterusan digantikan dengan vektor buku kod terdekat mereka, dengan penganggar kecerunan 'lurus' supaya pengekod masih boleh belajar walaupun carian tidak boleh dibezakan. Menambahkan diskriminator GAN berasaskan tampalan pada bahagian atas pengekod automatik ialah perkara yang membolehkan VQGAN menggunakan grid token yang jauh lebih kecil (cth. 16x16) daripada VQVAE sambil mengekalkan tekstur yang segar, menjadikan pemodelan pengubah mudah dikendalikan.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan VQGAN dan Sintesis Imej Buku Kod

Resipi token diskret VQGAN menjadi asas untuk model imej dan video berasaskan token, daripada MaskGIT kepada sistem multimodal yang mencampurkan token imej dan teks dalam satu pengubah. Penyelidikan kini mendorong ke arah buku kod yang lebih besar, skalar terhingga atau bebas carian yang mengelakkan keruntuhan buku kod dan ke arah model bersatu di mana perbendaharaan kata yang sama merangkumi imej, audio dan bahasa, membolehkan mana-mana generasi.

Pelaksanaan Dunia Sebenar

Mengekodkan foto ke dalam grid 16x16 token buku kod supaya pengubah boleh memodelkan dan menjananya semula

Memadankan VQGAN dengan panduan CLIP untuk mencipta seni AI 'VQGAN+CLIP' yang nyata yang menjadi tular pada tahun 2021

Memampatkan imej menjadi kod diskret padat untuk storan yang cekap atau latihan generatif hiliran

Berkhidmat sebagai tokenizer imej di dalam penjana berasaskan token yang lebih besar seperti MaskGIT dan transformer multimodal

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Sintesis Imej Semantik SPADE

Soalan lazim

What is VQGAN and Codebook Image Synthesis?

VQGAN memampatkan imej ke dalam grid token diskret yang diambil daripada buku kod yang dipelajari, membenarkan pengubah menjana imej dengan cara yang sama model bahasa menjana teks.

Apakah yang digunakan oleh VQGAN untuk mewakili imej sebagai token diskret?

VQGAN mengkuantumkan ciri pengekod kepada entri terdekat dalam buku kod yang dipelajari, menjadikan imej itu menjadi urutan indeks kod diskret.

Mengapakah VQGAN menambah diskriminator GAN di atas VQVAE?

Kehilangan permusuhan dan persepsi membolehkan VQGAN membina semula imej yang jelas daripada grid token padat, yang VQVAE sahaja cenderung kabur.

Sebaik sahaja imej adalah urutan token, model apakah yang menjana imej baharu?

Oleh kerana imej menjadi jujukan token diskret, pengubah boleh memodelkannya secara autoregresif, sama seperti menjana teks.

Apakah teknik yang membolehkan kecerunan mengalir melalui langkah pengkuantitian tidak boleh dibezakan?

Pengkuantitian vektor tidak boleh dibezakan, jadi VQGAN menggunakan penganggar kecerunan lurus untuk melatih pengekod.

Apakah aliran seni AI terkenal yang VQGAN bantu cipta pada tahun 2021?

Memadankan VQGAN dengan panduan CLIP menghasilkan seni 'VQGAN+CLIP' yang dikongsi secara meluas yang mempopularkan penjanaan imej dipacu teks.