Vizuális MI ÚTMUTATÓ

VQ-VAE és diszkrét látensek

A VQ-VAE a képeket, hangot vagy videót egy betanult kódkönyvből származó diszkrét kódok kis rácsába tömöríti folyamatos számok helyett.

2 perc olvasásUtoljára frissítve

Áttekintés

This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.

Mély merülés

A VQ-VAE (Vector Quantized Variational Autoencoder), amelyet van den Oord és munkatársai vezettek be a DeepMindnél 2017-ben, egy olyan autoencoder, amelynek látens tere diszkrét. Egy kódoló a képet folytonos vektorok rácsává alakítja; Ezután minden vektor a legközelebbi bejegyzéshez kerül a beágyazások tanult kódkönyvében (vektorkvantálás). A dekóder ezekből a kvantált kódokból rekonstruálja a képet. Mivel a látensek ma már az indexek véges szókincse, egy külön modell képes megtanulni eloszlásukat és új tartalmat generálni. Ez a kétlépcsős recept a DALL-E 1-et, a zenei Jukeboxot és a VQGAN-t támogatja, amely érzékelési és ellenséges veszteséget ad az élesebb rekonstrukcióhoz. A VQ-VAE-2 több felbontást halmozott fel, hogy nagy hűségű képeket készítsen.

Technikai betekintés

A kvantálási lépés (argmin legközelebbi szomszéd keresés) nem differenciálható, ezért a VQ-VAE egy egyenes becslőt használ: a gradienseket közvetlenül a dekódoló bemenetéről másolja vissza a kódoló kimenetére, mintha a kvantálás lenne az azonosság. A képzés egyesíti a rekonstrukciós veszteséget, a kódkönyvvesztést, amely a beágyazásokat a kódoló kimenetei felé húzza, és egy elkötelezettségi veszteséget, amely a kódolót a választott kódok iránt elkötelezetten tartja. Gyakori hiba a kódkönyv összeomlása, ahol csak néhány kód szokott hozzá.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A VQ-VAE és a diszkrét látensek jövője

A diszkrét látensek központi szerepet játszanak az egységes multimodális modellek felé való törekvésben, amelyek a képeket, a hangot és a videót a szöveggel azonos szókincsbe foglalják. Az olyan fejlesztések, mint a maradék és véges skaláris kvantálás, a nagyobb kódkönyvek és a jobb használat kiegyensúlyozása csökkentik az összeomlást és javítják a hűséget. Mivel a modellek célja a különböző módozatok megértése és generálása, a VQ-VAE ötletekre épülő robusztus tokenizátorok továbbra is alapvető összetevők maradnak, amelyek egyre inkább versenyeznek és kombinálódnak a folyamatos látens diffúziós megközelítésekkel.

Valós megvalósítás

A DALL-E 1 diszkrét VQ-VAE tokenizátort használt, így a Transformer képes képeket generálni kódkönyvi indexek sorozataként.

A VQGAN a VQ-VAE-t az ellenséges és az észlelési veszteségekkel kombinálva éles, nagy felbontású képjelzőket állított elő a művészetek generálásához.

A OpenAI Jukeboxja VQ-VAE-t alkalmazott nyers hangra, és a zenét külön kódokká tömörítette a generatív modellezés érdekében.

A VQ-VAE-2 hierarchikus diszkrét látenseket halmozott fel, hogy változatos, nagy hűségű képeket szintetizáljon, amelyek vetekednek korának GAN-jaival.

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQ-VAE and Discrete Latents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Látens keverés és képinterpoláció

Gyakran ismételt kérdések

What is VQ-VAE and Discrete Latents?

A VQ-VAE a képeket, hangot vagy videót egy betanult kódkönyvből származó diszkrét kódok kis rácsába tömöríti folyamatos számok helyett. Ez a diszkrét szűk keresztmetszet lehetővé teszi az olyan erőteljes sorozatmodellek számára, mint a Transformers, hogy a médiát „tokenként” kezeljék, hasonlóan a szavakhoz.

Miben különbözik a VQ-VAE látens tere a szabványos VAE-től?

A VQ-VAE a folytonos látenseket egy tanult kódkönyvből vektorkvantálással levont diszkrét kódokra cseréli.

Hogyan engedi át a VQ-VAE a gradienseket a nem differenciálható kvantálási lépésen?

Az egyenes becslő a dekóder bemeneti gradienst közvetlenül a kódoló kimenetére másolja, és a kvantálást a visszafelé lépés azonosítójaként kezeli.

Mi az a „kódkönyv összeomlása”?

A kódkönyv összeomlása akkor következik be, amikor a modell csak néhány kódra támaszkodik, elpazarolva a kódkönyv nagy részét, és sérti a sokszínűséget.

Miért hasznosak a diszkrét látensek a Transformers generatív modellezéshez?

A diszkrét indexek véges szókincset alkotnak, így az olyan sorozatmodellek, mint a Transformers, ugyanúgy tanulhatnak és mintát vehetnek eloszlásukból, mint a szavak.

Mit adott hozzá a VQGAN az alap VQ-VAE recepthez?

A VQGAN megkülönböztetővel és észlelési veszteséggel bővíti a VQ-VAE-t, így élesebb, részletesebb rekonstruált tokeneket eredményez.