Vizuális MI ÚTMUTATÓ

VQGAN és Codebook képszintézis

A VQGAN a képeket egy tanult kódkönyvből húzott diszkrét tokenek rácsába tömöríti, így a transzformátor ugyanúgy képes képeket generálni, mint a nyelvi modellek szöveget.

2 perc olvasásUtoljára frissítve

Mély merülés

A VQGAN, amelyet a 2021-es „Transformátorok megszelídítése a nagyfelbontású képszintézishez” című tanulmányban mutattak be, a vektorkvantált autoencodert (VQVAE) az ellenséges és perceptuális képzéssel kombinálja. A kódoló a képet egy kis jellemzővektor-rácsra képezi le; minden vektort a legközelebbi bejegyzéshez illesztenek egy tanult kódkönyvben, mondjuk 1024 diszkrét kódból, és a képet egész számok tokenek sorozatává alakítják. Egy dekóder rekonstruálja a képet ezekből a tokenekből, GAN diszkriminátorral és észlelési veszteséggel betanítva, így a rekonstrukciók inkább élesek, mint elmosódottak. Mivel a képek ma már diszkrét token sorozatok, egy autoregresszív transzformátor képes modellezni őket, mint a nyelvet, egyenként előre jelezve a tokeneket. A VQGAN híresen hajtotta a korai szöveg-kép művészeti eszközöket, ha a CLIP útmutatással párosul.

Technikai betekintés

Az alapművelet a vektorkvantálás: a folyamatos kódoló kimeneteit a legközelebbi kódkönyvvektorok helyettesítik egy „egyenes” gradiensbecslővel, így a kódoló a nem differenciálható keresés ellenére is tanulni tud. A patch-alapú GAN diszkriminátor hozzáadása az autoencoderhez lehetővé teszi, hogy a VQGAN sokkal kisebb token rácsot (pl. 16x16) használjon, mint a VQVAE, miközben a textúrák élesek maradnak, így a transzformátor modellezése kezelhetővé válik.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A VQGAN és a Codebook Image Synthesis jövője

A VQGAN diszkrét token receptje lett a token alapú kép- és videómodellek alapja, a MaskGIT-től a multimodális rendszerekig, amelyek egy transzformátorban keverik a képet és a szöveget. A kutatás most a nagyobb, véges skaláris vagy keresés nélküli kódkönyvek felé törekszik, amelyek elkerülik a kódkönyv összeomlását, és olyan egységes modellek felé, amelyekben ugyanaz a szókincs felöleli a képeket, a hangot és a nyelvet, lehetővé téve a bármely generációt.

Valós megvalósítás

Fénykép kódolása egy 16x16-os kódkönyv-token rácsba, hogy a transzformátor modellezhesse és újragenerálhassa

A VQGAN és a CLIP útmutatás párosítása a szürreális „VQGAN+CLIP” AI művészet létrehozásához, amely 2021-ben terjedt el.

Képek tömörítése kompakt diszkrét kódokba a hatékony tárolás vagy a későbbi generatív képzés érdekében

Képtokenizálóként szolgál nagyobb token-alapú generátorokban, mint például a MaskGIT és a multimodális transzformátorok

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

SPADE szemantikus képszintézis

Gyakran ismételt kérdések

What is VQGAN and Codebook Image Synthesis?

A VQGAN a képeket egy tanult kódkönyvből húzott diszkrét tokenek rácsába tömöríti, így a transzformátor ugyanúgy képes képeket generálni, mint a nyelvi modellek szöveget.

Mit használ a VQGAN egy kép diszkrét tokenként való megjelenítésére?

A VQGAN a kódoló jellemzőit a tanult kódkönyv legközelebbi bejegyzéseihez kvantálja, és a képet diszkrét kódindexek sorozatává alakítja.

Miért ad hozzá a VQGAN GAN diszkriminátort a VQVAE mellé?

Az ellenséges és észlelési veszteségek lehetővé teszik a VQGAN számára, hogy éles képeket rekonstruáljon egy kompakt token rácsból, amelyet a VQVAE önmagában hajlamos elmosni.

Ha egy kép tokenek sorozata, melyik modell hoz létre új képeket?

Mivel a képek diszkrét token sorozatokká válnak, a transzformátor autoregresszív módon modellezheti őket, akárcsak a szöveget.

Milyen technika engedi át a gradienseket a nem differenciálható kvantálási lépésen?

A vektorkvantálás nem differenciálható, ezért a VQGAN egy egyenes gradiensbecslőt használ a kódoló betanításához.

Milyen híres AI művészeti irányzatot segített a VQGAN létrehozni 2021-ben?

A VQGAN és a CLIP útmutatás párosítása létrehozta a széles körben megosztott „VQGAN+CLIP” művészetet, amely népszerűsítette a szövegvezérelt képgenerálást.