GHID AI vizual

Sinteza imaginilor VQGAN și Codebook

VQGAN comprimă imaginile într-o grilă de jetoane discrete extrase dintr-o carte de coduri învățată, permițând unui transformator să genereze imagini în același mod în care modelele de limbaj generează text.

2 minute de lecturăUltima actualizare

Scufundare în profunzime

VQGAN, introdus în lucrarea din 2021 „Taming Transformers for High-Resolution Image Synthesis”, combină un autoencoder cuantizat vector (VQVAE) cu antrenament adversar și perceptiv. Un encoder mapează o imagine la o mică grilă de vectori caracteristici; fiecare vector este fixat la cea mai apropiată intrare într-o carte de coduri învățată de, să zicem, 1024 de coduri discrete, transformând imaginea într-o secvență de jetoane întregi. Un decodor reconstruiește imaginea din acele jetoane, antrenate cu un discriminator GAN și pierderi de percepție, astfel încât reconstrucțiile să pară clare mai degrabă decât neclare. Deoarece imaginile sunt acum secvențe de jetoane discrete, un transformator autoregresiv le poate modela ca un limbaj, prezicând jetoanele unul câte unul. VQGAN a alimentat instrumentele artistice timpurii text-to-image atunci când a fost asociat cu ghidaj CLIP.

Perspectivă tehnică

Operația de bază este cuantizarea vectorială: ieșirile continue ale codificatorului sunt înlocuite cu cei mai apropiați vectori ai codurilor, cu un estimator de gradient „direct”, astfel încât codificatorul să poată învăța în continuare în ciuda căutării nediferențiabile. Adăugarea unui discriminator GAN bazat pe patch-uri deasupra codificatorului automat este ceea ce permite VQGAN să utilizeze o grilă de simboluri mult mai mică (de exemplu, 16x16) decât VQVAE, păstrând în același timp texturile clare, făcând modelarea transformatorului manevrabilă.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul VQGAN și Sinteza imaginilor Codebook

Rețeta de jetoane discrete a VQGAN a devenit baza pentru modelele de imagini și video bazate pe jetoane, de la MaskGIT la sisteme multimodale care amestecă jetoane de imagine și text într-un singur transformator. Cercetarea se îndreaptă acum către liste de coduri mai mari, scalare finite sau fără căutări, care evită colapsul listei de coduri și spre modele unificate în care același vocabular cuprinde imagini, audio și limbaj, permițând orice generație.

Implementare în lumea reală

Codificarea unei fotografii într-o grilă de 16x16 de jetoane din cartea de coduri, astfel încât un transformator să o poată modela și regenera

Asocierea VQGAN cu îndrumarea CLIP pentru a crea arta suprarealistă AI „VQGAN+CLIP” care a devenit virală în 2021

Comprimarea imaginilor în coduri discrete compacte pentru stocare eficientă sau antrenament generativ în aval

Servind drept tokenizer de imagine în generatoare mai mari bazate pe token, cum ar fi MaskGIT și transformatoare multimodale

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Sinteza imaginii semantice SPADE

Întrebări frecvente

What is VQGAN and Codebook Image Synthesis?

VQGAN comprimă imaginile într-o grilă de jetoane discrete extrase dintr-o carte de coduri învățată, permițând unui transformator să genereze imagini în același mod în care modelele de limbaj generează text.

Ce folosește VQGAN pentru a reprezenta o imagine ca simboluri discrete?

VQGAN cuantifică caracteristicile codificatorului la cele mai apropiate intrări dintr-o carte de coduri învățată, transformând imaginea într-o secvență de indici de cod discret.

De ce VQGAN adaugă un discriminator GAN peste un VQVAE?

Pierderile adverse și perceptuale permit VQGAN să reconstruiască imagini clare dintr-o grilă de simboluri compacte, pe care doar VQVAE tinde să o estompeze.

Odată ce o imagine este o secvență de jetoane, ce model generează imagini noi?

Deoarece imaginile devin secvențe de simboluri discrete, un transformator le poate modela autoregresiv, la fel ca la generarea textului.

Ce tehnică permite gradienților să curgă prin etapa de cuantificare nediferențiabilă?

Cuantificarea vectorială este nediferențiabilă, așa că VQGAN utilizează un estimator de gradient direct pentru a antrena codificatorul.

Ce tendință celebră de artă AI a ajutat VQGAN să creeze în 2021?

Asocierea VQGAN cu ghidaj CLIP a produs arta „VQGAN+CLIP” care a popularizat generarea de imagini bazată pe text.