GHID AI vizual

Decodarea paralelă a tokenurilor MaskGIT

MaskGIT generează imagini prin prezicerea mai multor jetoane simultan și completându-le mai întâi pe cele mai sigure, înlocuind generarea lentă de la stânga la dreapta cu o mână de pași paraleli rapidi.

2 minute de lecturăUltima actualizare

Scufundare în profunzime

MaskGIT (Masked Generative Image Transformer), de la Google în 2022, regândește modul în care modelele de imagine bazate pe token decodifică. Transformatoarele anterioare, cum ar fi VQGAN, generau jetoane autoregresiv, unul câte unul în ordine raster, ceea ce este lent și nenatural pentru imaginile 2D. MaskGIT se antrenează în schimb cu un obiectiv de modelare mascat precum BERT: subseturi aleatoare de jetoane de imagine sunt ascunse și modelul învață să le prezică pe toate simultan folosind atenția bidirecțională. La momentul generarii, pornește de la o grilă complet mascată și decodifică într-un număr fix de iterații (adesea de la 8 la 12). La fiecare pas, acesta prezice fiecare jeton mascat, păstrează predicțiile cu cea mai mare încredere și re-maschează restul pentru runda următoare. Acest lucru produce imagini de înaltă calitate în aproximativ un ordin de mărime mai puțini pași decât decodificarea autoregresivă.

Perspectivă tehnică

Componenta crucială este programul de mascare bazat pe încredere. Un program de cosinus decide câte jetoane să dezvăluie fiecare iterație, începând lent și accelerând. Deoarece atenția este bidirecțională, fiecare simbol vede întreaga imagine parțială, așa că efectuarea celor mai sigure predicții permite ca pașii de mai târziu să se condiționeze de context solid, la fel ca rezolvarea părților ușoare ale unui puzzle înaintea celor ambigue.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul MaskGIT Parallel Token Decoding

Decodificarea paralelă iterativă a MaskGIT a inspirat un val de generatoare neautoregresive, inclusiv MUSE pentru text-to-image și abordări mascate pentru video. Modelul, care prezice jetoanele în paralel și se rafinează în câțiva pași, se află între GAN-urile cu un singur pas și difuzarea în mai mulți pași, oferind un compromis reglabil calitate-viteză. Așteptați-vă ca decodificarea token-ului mascat să continue să apară în generatoarele multimodale rapide și sistemele de editare în care pictura în interior și umplerile condiționate se potrivesc firesc.

Implementare în lumea reală

Generarea unei imagini complete în aproximativ 8 până la 12 pași paraleli în loc de sute de predicții cu simboluri autoregresive

Pictarea unei regiuni mascate a unei fotografii prin re-previziunea doar a indicatoarelor ascunse cu contextul înconjurător

Sinteză de imagini condiționată de clasă pe ImageNet la o calitate competitivă cu modelele mult mai lente

Servind drept coloană vertebrală de decodare pentru sistemele text-to-image, cum ar fi MUSE-ul lui Google, care necesită generare rapidă

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Decodare paralelă a scheletului gândirii

Întrebări frecvente

What is MaskGIT Parallel Token Decoding?

MaskGIT generează imagini prin prezicerea mai multor jetoane simultan și completându-le mai întâi pe cele mai sigure, înlocuind generarea lentă de la stânga la dreapta cu o mână de pași paraleli rapidi.

Cum decodifică MaskGIT jetoanele de imagine diferit de transformatorul VQGAN?

MaskGIT prezice toate jetoanele mascate simultan cu atenție bidirecțională, spre deosebire de decodificarea autoregresivă lentă de la stânga la dreapta a VQGAN.

Ce obiectiv de formare împrumută MaskGIT din modelele lingvistice?

MaskGIT ascunde subseturi aleatoare de jetoane și învață să le prezică, un obiectiv de modelare mascat similar cu BERT.

În timpul generării, ce simboluri comite MaskGIT la fiecare iterație?

Fiecare pas păstrează cele mai încrezătoare predicții și re-maschează restul, astfel încât pașii ulterioare condiționează contextul fiabil.

Aproximativ de câte iterații are nevoie de obicei MaskGIT pentru a genera o imagine?

MaskGIT decodifică într-un număr fix mic de pași, adesea de la 8 la 12, mult mai puțini decât abordările autoregresive sau de difuzie.

Ce program controlează câte jetoane dezvăluie MaskGIT la fiecare pas?

Un program de cosinus dezvăluie puține jetoane devreme și mai multe mai târziu, echilibrând calitatea și viteza pe parcursul iterațiilor.