Visuell AI GUIDE

MaskGIT Parallell Token Decoding

MaskGIT genererer bilder ved å forutsi mange tokens på en gang og fylle ut de mest selvsikre først, og erstatte langsom venstre-til-høyre generasjon med en håndfull raske parallelle trinn.

2 min lesingSist oppdatert

Dypdykk

MaskGIT (Masked Generative Image Transformer), fra Google i 2022, revurderer hvordan tokenbaserte bildemodeller dekoder. Tidligere transformatorer som VQGAN genererte tokens autoregressivt, én om gangen i rasterrekkefølge, noe som er tregt og unaturlig for 2D-bilder. MaskGIT trener i stedet med et maskert modelleringsmål som BERT: tilfeldige delsett av bildetokens er skjult og modellen lærer å forutsi dem alle samtidig ved å bruke toveis oppmerksomhet. På generasjonstidspunktet starter den fra et fullstendig maskert rutenett og dekoder i et fast antall iterasjoner (ofte 8 til 12). Hvert trinn forutsier hvert maskert token, beholder spådommene med høyest tillit, og maskerer resten på nytt for neste runde. Dette gir bilder av høy kvalitet i omtrent en størrelsesorden færre trinn enn autoregressiv dekoding.

Teknisk innsikt

Den avgjørende komponenten er den tillitsbaserte maskeringsplanen. En cosinus-plan bestemmer hvor mange tokens som skal avsløre hver iterasjon, starter sakte og akselererer. Fordi oppmerksomhet er toveis, ser hvert symbol hele delbildet, så ved å begå de mest sikre spådommene først, lar senere trinn betinge seg av solid kontekst, omtrent som å løse de enkle delene av et puslespill før de tvetydige.

Strategisk innvirkning

Speed and scale

Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.

Build choices

Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.

Team and workflow

Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.

Fremtiden til MaskGIT Parallell Token Decoding

MaskGITs parallelle iterative dekoding inspirerte en bølge av ikke-autoregressive generatorer, inkludert MUSE for tekst-til-bilde og maskerte tilnærminger for video. Mønsteret, som forutsier tokens parallelt og raffinerer over noen få trinn, ligger mellom one-shot GANs og mange-trinns diffusjon, og tilbyr en justerbar avveining mellom kvalitet og hastighet. Forvent at maskert token-dekoding fortsetter å dukke opp i raske multimodale generatorer og redigeringssystemer der in-painting og betingede fyll passer naturlig.

Real-World Implementering

Genererer et fullstendig bilde i omtrent 8 til 12 parallelle trinn i stedet for hundrevis av autoregressive token-prediksjoner

Å male et maskert område av et bilde ved å forutsi bare de skjulte symbolene med omgivende kontekst

Klassebetinget bildesyntese på ImageNet med kvalitet konkurransedyktig med mye tregere modeller

Fungerer som dekodingsryggraden for tekst-til-bilde-systemer som Googles MUSE som trenger rask generering

Risikoer og rekkverk

Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.

Modellytelsen kan variere på tvers av belysning, demografi og miljøer.

Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.

Veikart for implementering

1

Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.

2

Test med data som samsvarer med reelle produksjonsforhold.

3

Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.

4

Spor modelldrift og revalider etter endringer i kamera eller datasett.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Skjelett-of-Thought Parallell Decoding

Ofte stilte spørsmål

What is MaskGIT Parallel Token Decoding?

MaskGIT genererer bilder ved å forutsi mange tokens på en gang og fylle ut de mest selvsikre først, og erstatte langsom venstre-til-høyre generasjon med en håndfull raske parallelle trinn.

Hvordan dekoder MaskGIT bildetokens annerledes enn VQGANs transformator?

MaskGIT forutsier alle maskerte tokens samtidig med toveis oppmerksomhet, i motsetning til VQGANs sakte venstre-til-høyre autoregressive dekoding.

Hvilket treningsmål låner MaskGIT fra språkmodeller?

MaskGIT skjuler tilfeldige undersett av tokens og lærer å forutsi dem, et maskert modelleringsmål som ligner på BERT.

Hvilke tokens forplikter MaskGIT ved hver iterasjon under generering?

Hvert trinn beholder de mest sikre spådommene og maskerer resten på nytt, så senere trinn forutsetter pålitelig kontekst.

Omtrent hvor mange iterasjoner trenger MaskGIT vanligvis for å generere et bilde?

MaskGIT dekoder i et lite fast antall trinn, ofte 8 til 12, langt færre enn autoregressive eller diffusjonstilnærminger.

Hvilken tidsplan kontrollerer hvor mange tokens MaskGIT avslører hvert trinn?

En kosinusplan avslører få tokens tidlig og flere senere, og balanserer kvalitet og hastighet på tvers av iterasjoner.