Visuell AI GUIDE

VQGAN og kodebok bildesyntese

VQGAN komprimerer bilder til et rutenett av diskrete tokens hentet fra en lært kodebok, og lar en transformator generere bilder på samme måte som språkmodeller genererer tekst.

2 min lesingSist oppdatert

Dypdykk

VQGAN, introdusert i 2021-artikkelen 'Taming Transformers for High-Resolution Image Synthesis', kombinerer en vektorkvantisert autoenkoder (VQVAE) med motstridende og perseptuell trening. En koder kartlegger et bilde til et lite rutenett av funksjonsvektorer; hver vektor snappes til nærmeste oppføring i en lært kodebok med for eksempel 1024 diskrete koder, og gjør bildet om til en sekvens av heltallssymboler. En dekoder rekonstruerer bildet fra disse tokenene, trent med en GAN-diskriminator og perseptuellt tap slik at rekonstruksjoner ser skarpe ut i stedet for uskarpe. Fordi bilder nå er diskrete token-sekvenser, kan en autoregressiv transformator modellere dem som språk, og forutsi tokens én etter én. VQGAN drev kjente tidlige tekst-til-bilde-kunstverktøy når de ble paret med CLIP-veiledning.

Teknisk innsikt

Kjerneoperasjonen er vektorkvantisering: kontinuerlige koderutganger erstattes av deres nærmeste kodebokvektorer, med en 'rett-gjennom' gradientestimator slik at koderen fortsatt kan lære til tross for det ikke-differensierbare oppslaget. Å legge til en patch-basert GAN-diskriminator på toppen av autoenkoderen er det som lar VQGAN bruke et mye mindre token-rutenett (f.eks. 16x16) enn VQVAE, samtidig som det holder teksturer skarpe, noe som gjør transformatormodellering mulig.

Strategisk innvirkning

Speed and scale

Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.

Build choices

Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.

Team and workflow

Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.

Fremtiden til VQGAN og kodebokbildesyntese

VQGANs diskrete-token-oppskrift ble grunnlaget for token-baserte bilde- og videomodeller, fra MaskGIT til multimodale systemer som blander bilde- og teksttokens i én transformator. Forskning presser nå mot større, endelig skalar eller oppslagsfrie kodebøker som unngår kodebokkollaps og mot enhetlige modeller der det samme vokabularet spenner over bilder, lyd og språk, noe som muliggjør generasjon fra enhver til enhver.

Real-World Implementering

Kode et bilde til et 16x16 rutenett med kodebok-tokens, slik at en transformator kan modellere og regenerere det

Pare VQGAN med CLIP-veiledning for å lage den surrealistiske "VQGAN+CLIP" AI-kunsten som gikk viralt i 2021

Komprimering av bilder til kompakte diskrete koder for effektiv lagring eller nedstrøms generativ trening

Fungerer som bildetokenizer i større tokenbaserte generatorer som MaskGIT og multimodale transformatorer

Risikoer og rekkverk

Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.

Modellytelsen kan variere på tvers av belysning, demografi og miljøer.

Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.

Veikart for implementering

1

Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.

2

Test med data som samsvarer med reelle produksjonsforhold.

3

Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.

4

Spor modelldrift og revalider etter endringer i kamera eller datasett.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

SPADE Semantisk bildesyntese

Ofte stilte spørsmål

What is VQGAN and Codebook Image Synthesis?

VQGAN komprimerer bilder til et rutenett av diskrete tokens hentet fra en lært kodebok, og lar en transformator generere bilder på samme måte som språkmodeller genererer tekst.

Hva bruker VQGAN for å representere et bilde som diskrete tokens?

VQGAN kvantiserer koderfunksjoner til de nærmeste oppføringene i en innlært kodebok, og gjør bildet om til en sekvens av diskrete kodeindekser.

Hvorfor legger VQGAN til en GAN-diskriminator på toppen av en VQVAE?

De motstridende og perseptuelle tapene lar VQGAN rekonstruere skarpe bilder fra et kompakt token-rutenett, som VQVAE alene har en tendens til å uskarpe.

Når et bilde er en sekvens av tokens, hvilken modell genererer nye bilder?

Fordi bilder blir diskrete token-sekvenser, kan en transformator modellere dem autoregressivt, akkurat som å generere tekst.

Hvilken teknikk lar gradienter flyte gjennom det ikke-differensierbare kvantiseringstrinnet?

Vektorkvantisering er ikke-differensierbar, så VQGAN bruker en straight-through gradientestimator for å trene koderen.

Hvilken kjent AI-kunsttrend hjalp VQGAN med å skape i 2021?

Sammenkobling av VQGAN med CLIP-veiledning ga den mye delte 'VQGAN+CLIP'-kunsten som populariserte tekstdrevet bildegenerering.