Vizuális MI ÚTMUTATÓ

Muse maszkos generatív képalkotás

A Muse a Google szöveg-képmodellje, amely maszkolt képjelek egyidejű kitöltésével állít elő képeket, így sokkal gyorsabb, mint a lépésről lépésre történő diffúzió.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

Mély merülés

A Muse a kép diszkrét tokenterében működik. Az előképzett VQGAN a képet egész tokenek rácsává alakítja, mint a vizuális építőelemek szókincsévé. A képzés során ezeknek a tokeneknek a nagy része el van takarva, és a Transformer megtanulja visszajósolni őket, egy lefagyott nagy nyelvi modellből (T5-XXL) származó szövegbeágyazások függvényében. Generáció idején a Muse egy teljesen maszkolt rácsból indul ki, és párhuzamos körökben dekódol, lépésenként sok tokent jósol meg, és újramaszkolja a legkevésbé magabiztosakat. A kétlépcsős tervezés először egy kis felbontású token rácsot hoz létre, majd egy szuperfelbontású modell kitölt egy nagyobb felbontású rácsot. Mivel több tucat token egyidejűleg oldódik fel, a 900M és a 3B paraméteres modellek 256 vagy 512 pixeles képet készítenek csak néhány előrehaladással.

Technikai betekintés

A fő trükk a párhuzamos dekódolás bizalom alapú újramaszkolással, amelyet gyakran MaskGIT-stílusú mintavételezésnek neveznek. Ahelyett, hogy egy-egy jelzőt előre jelezne (autoregresszív) vagy több százszor denoisálna (diffúzió), a Muse megjósolja az összes maszkolt jelzőt, megtartja a legmagabiztosabbakat, a többit pedig újramaszkolja a következő körre. A lefagyott T5-XXL szövegkódoló használata erős nyelvértést biztosít ingyenesen, a diszkrét tokenekkel való működés pedig lehetővé teszi, hogy a modell szavakhoz hasonló képekről okoskodjon.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A Muse Masked Generative Imaging jövője

A maszkolt párhuzamos dekódolás a kiváló minőségű és valóban gyors generátorok felé mutat, ami elengedhetetlen az interaktív szerkesztéshez és az eszközön történő használathoz. Várható, hogy a token-előrejelzés ötlet egyesüljön a diffúziós és az autoregresszív videomódszerekkel, és azonnali befestést, kifestést és maszk nélküli szerkesztést biztosítson. Ahogy a diszkrét tokenizátorok javulnak, a maszkolt képalkotás egyértelműen kiterjedhet a videóra és a 3D-re is, ahol a párhuzamos dekódolás jelentősen csökkentheti számos képkocka vagy nézet létrehozásának költségeit.

Valós megvalósítás

Rapid concept art és hangulattáblák, ahol a művésznek sok képváltozatra van szüksége percek helyett másodpercek alatt.

Zero-shot festés, például egy objektum eltávolítása és a modell kitöltése a maszkolt területtel összhangban a környezettel.

Kifestés a fénykép eredeti határain túlra való kiterjesztésére szalaghirdetések vagy eltérő képarányok miatt.

Maszk nélküli szerkesztés, például a kutya színének vagy az égboltnak napnyugtára váltása a szöveges prompt szerkesztésével és az érintett tokenek újradekódolásával.

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Maszkos automatikus kódolók

Gyakran ismételt kérdések

What is Muse Masked Generative Imaging?

A Muse a Google szöveg-képmodellje, amely maszkolt képjelek egyidejű kitöltésével állít elő képeket, így sokkal gyorsabb, mint a lépésről lépésre történő diffúzió. Ez azért fontos, mert megmutatta, hogy kiváló minőségű, jól igazított képeket készíthet a legtöbb generátor által használt lassú iteratív zajtalanítás nélkül.

Mit jósol a Muse a generálás során a pixelek zajtalanítása helyett?

A Muse egy diszkrét tokentérben működik, a VQGAN tokenizátor által előállított maszkolt kép tokeneket előrejelezve, nem pedig közvetlenül a pixeleken dolgozva.

Miért gyorsabb a Muse, mint a szabványos diffúziós modellek?

A Muse egyszerre sok maszkolt tokent tölt ki, és csak néhány dekódolási körre van szüksége, ellentétben a diffúzió számos szekvenciális zajtalanítási lépésével.

Honnan veszi a Muse a szövegértést?

A Muse előképzett T5-XXL nyelvi modellből generál szövegbeágyazásokat, erős nyelvértést biztosítva.

Mi a szerepe a bizalom alapú újramaszkolásnak a Muse-ban?

Minden párhuzamos előrejelzés után a Muse megtartja a legmagabiztosabb jelzőket, és újramaszkolja a legkevésbé magabiztosakat, hogy finomítsa az egymást követő körökben.

Hogyan kezeli a Muse a nagyobb felbontású képek készítését?

A Muse először egy alacsony felbontású token rácsot hoz létre, majd egy második szuperfelbontású modell egy nagyobb felbontású token rácsot.