Visuele AI-GIDS

VQGAN en codeboekbeeldsynthese

VQGAN comprimeert afbeeldingen in een raster van afzonderlijke tokens die zijn ontleend aan een aangeleerd codeboek, waardoor een transformator afbeeldingen kan genereren op dezelfde manier waarop taalmodellen tekst genereren.

2 min readLaatst bijgewerkt

Diepe duik

VQGAN, geïntroduceerd in de paper 'Taming Transformers for High-Resolution Image Synthesis' uit 2021, combineert een vector-gekwantiseerde auto-encoder (VQVAE) met vijandige en perceptuele training. Een encoder wijst een afbeelding toe aan een klein raster van kenmerkvectoren; elke vector wordt naar de dichtstbijzijnde ingang in een geleerd codeboek van bijvoorbeeld 1024 afzonderlijke codes geklikt, waardoor het beeld wordt omgezet in een reeks geheeltallige tokens. Een decoder reconstrueert het beeld van die tokens, getraind met een GAN-discriminator en perceptueel verlies, zodat reconstructies er scherp uitzien in plaats van wazig. Omdat afbeeldingen nu afzonderlijke tokenreeksen zijn, kan een autoregressieve transformator ze als taal modelleren en tokens één voor één voorspellen. VQGAN stond bekend om de vroege tekst-naar-afbeelding-kunsttools in combinatie met CLIP-begeleiding.

Technisch inzicht

De kernbewerking is vectorkwantisering: continue encoderuitgangen worden vervangen door hun dichtstbijzijnde codeboekvectoren, met een 'straight-through' gradiëntschatter, zodat de encoder nog steeds kan leren ondanks de niet-differentieerbare opzoeking. Het toevoegen van een patch-gebaseerde GAN-discriminator bovenop de autoencoder zorgt ervoor dat VQGAN een veel kleiner tokenraster (bijvoorbeeld 16x16) kan gebruiken dan VQVAE, terwijl de texturen helder blijven, waardoor transformatormodellering handelbaar wordt.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van VQGAN en codeboekbeeldsynthese

Het discrete token-recept van VQGAN werd de basis voor op tokens gebaseerde beeld- en videomodellen, van MaskGIT tot multimodale systemen die beeld- en teksttokens in één transformator combineren. Onderzoek beweegt zich nu in de richting van grotere, eindig-scalaire of opzoekvrije codeboeken die het instorten van codeboeken voorkomen, en in de richting van uniforme modellen waarin hetzelfde vocabulaire afbeeldingen, audio en taal omvat, waardoor elke generatie mogelijk wordt.

Implementatie in de echte wereld

Coderen van een foto in een 16x16 raster van codeboektokens, zodat een transformator deze kan modelleren en regenereren

VQGAN koppelen aan CLIP-begeleiding om de surrealistische 'VQGAN+CLIP' AI-kunst te creëren die in 2021 viraal ging

Het comprimeren van afbeeldingen tot compacte discrete codes voor efficiënte opslag of downstream generatieve training

Het fungeert als de image-tokenizer binnen grotere, op tokens gebaseerde generatoren zoals MaskGIT en multimodale transformatoren

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

SPADE Semantische beeldsynthese

Frequently asked questions

What is VQGAN and Codebook Image Synthesis?

VQGAN comprimeert afbeeldingen in een raster van afzonderlijke tokens die zijn ontleend aan een aangeleerd codeboek, waardoor een transformator afbeeldingen kan genereren op dezelfde manier waarop taalmodellen tekst genereren.

Wat gebruikt VQGAN om een ​​afbeelding weer te geven als discrete tokens?

VQGAN kwantiseert encoderfuncties naar de dichtstbijzijnde vermeldingen in een geleerd codeboek, waardoor het beeld wordt omgezet in een reeks discrete code-indexen.

Waarom voegt VQGAN een GAN-discriminator toe bovenop een VQVAE?

Door de vijandige en perceptuele verliezen kan VQGAN scherpe beelden reconstrueren uit een compact tokenraster, dat alleen VQVAE de neiging heeft te vervagen.

Als een afbeelding eenmaal een reeks tokens is, welk model genereert dan nieuwe afbeeldingen?

Omdat afbeeldingen discrete tokenreeksen worden, kan een transformator ze autoregressief modelleren, net zoals bij het genereren van tekst.

Welke techniek laat gradiënten door de niet-differentieerbare kwantiseringsstap stromen?

Vectorkwantisering is niet-differentieerbaar, dus gebruikt VQGAN een straight-through gradiëntschatter om de encoder te trainen.

Welke beroemde AI-kunsttrend heeft VQGAN in 2021 helpen creëren?

Door VQGAN te combineren met CLIP-begeleiding ontstond de wijdverspreide 'VQGAN+CLIP'-kunst die het genereren van tekstgestuurde afbeeldingen populair maakte.