Vizuális MI ÚTMUTATÓ

MaskGIT párhuzamos token dekódolás

A MaskGIT úgy állít elő képeket, hogy egyszerre sok tokent jósol meg, és először a legbiztosabbakat tölti ki, a lassú balról jobbra történő generálást néhány gyors párhuzamos lépéssel helyettesítve.

2 perc olvasásUtoljára frissítve

Mély merülés

A 2022-es Google MaskGIT (Maszked Generatív Képtranszformátor) újragondolja a token alapú képmodellek dekódolását. A korábbi transzformátorok, például a VQGAN, autoregresszív módon, egyenként, raszteres sorrendben generálták a tokeneket, ami lassú és természetellenes a 2D képek esetében. A MaskGIT ehelyett egy maszkolt modellezési céllal, például a BERT-vel edz: a képjelek véletlenszerű részhalmazai el vannak rejtve, és a modell megtanulja mindet egyidejűleg előre jelezni a kétirányú figyelem segítségével. Generáláskor egy teljesen maszkolt rácsból indul ki, és meghatározott számú iterációval dekódolja (gyakran 8-tól 12-ig). Minden lépésben megjósol minden maszkolt tokent, megtartja a legmagasabb megbízhatóságú előrejelzéseket, a többit pedig újra elrejti a következő körre. Ez jó minőségű képeket hoz létre nagyjából egy nagyságrenddel kevesebb lépésben, mint az autoregresszív dekódolás.

Technikai betekintés

A döntő összetevő a bizalom alapú maszkolás ütemezése. A koszinusz ütemezés dönti el, hogy hány tokent kell felfedni az egyes iterációkban, lassan indulva és gyorsulva. Mivel a figyelem kétirányú, minden token a teljes képrészletet látja, így a legbiztosabb előrejelzések végrehajtása először lehetővé teszi, hogy a későbbi lépések szilárd kontextushoz kapcsolódjanak, hasonlóan ahhoz, mint a rejtvény könnyű részeit a kétértelműek előtt.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A MaskGIT párhuzamos token dekódolás jövője

A MaskGIT párhuzamos iteratív dekódolása nem autoregresszív generátorok hullámát inspirálta, beleértve a MUSE-t a szöveg-képké alakításhoz és a maszkos megközelítéseket a videóhoz. A tokeneket párhuzamosan előrejelző és néhány lépésben finomító minta az egyszeri GAN-ok és a többlépcsős diffúzió között helyezkedik el, hangolható minőség-sebesség kompromisszumot kínálva. Várhatóan a maszkolt token dekódolás továbbra is megjelenik a gyors multimodális generátorokban és szerkesztőrendszerekben, ahol a befestés és a feltételes kitöltések természetesek.

Valós megvalósítás

Teljes kép generálása körülbelül 8-12 párhuzamos lépésben több száz autoregresszív token előrejelzés helyett

A fénykép maszkolt részének megfestése úgy, hogy csak a rejtett tokeneket írja újra a környező kontextussal

Osztályos feltételes képszintézis az ImageNeten, sokkal lassabb modellekkel versenyképes minőségben

Dekódolási gerincként szolgál a gyors generálást igénylő szöveg-képrendszerekhez, például Google MUSE-jához

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Gondolati csontváz párhuzamos dekódolás

Gyakran ismételt kérdések

What is MaskGIT Parallel Token Decoding?

A MaskGIT úgy állít elő képeket, hogy egyszerre sok tokent jósol meg, és először a legbiztosabbakat tölti ki, a lassú balról jobbra történő generálást néhány gyors párhuzamos lépéssel helyettesítve.

Hogyan dekódolja a MaskGIT a képtokeneket a VQGAN transzformátorától eltérően?

A MaskGIT a VQGAN lassú, balról jobbra irányú autoregresszív dekódolásával ellentétben az összes maszkolt tokent egyidejűleg előrejelzi a kétirányú figyelem mellett.

Milyen képzési célt kölcsönöz a MaskGIT a nyelvi modellekből?

A MaskGIT elrejti a tokenek véletlenszerű részhalmazait, és megtanulja megjósolni őket, ez a BERT-hez hasonló maszkolt modellezési cél.

A generálás során mely tokeneket hajtja végre a MaskGIT minden iterációnál?

Minden lépés megtartja a legbiztosabb előrejelzéseket, a többit pedig újra elfedi, így a későbbi lépések megbízható kontextustól függenek.

Körülbelül hány iterációra van szüksége a MaskGIT-nek egy kép létrehozásához?

A MaskGIT kis fix számú lépésben dekódol, gyakran 8-12 lépésben, ami sokkal kevesebb, mint az autoregresszív vagy diffúziós megközelítés.

Milyen ütemezés szabályozza, hogy a MaskGIT hány tokent fed fel minden lépésben?

A koszinusz ütemezés néhány tokent tár fel korábban, és többet később, egyensúlyban tartva a minőséget és a sebességet az iterációk között.