Muse maskované generativní zobrazování
Muse je model převodu textu na obrázek od Google, který generuje obrázky vyplněním maskovaných obrazových tokenů najednou, takže je mnohem rychlejší než postupné šíření.
Přehled
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
Hluboký ponor
Muse pracuje v samostatném prostoru tokenů obrázku. Předtrénovaný VQGAN změní obrázek na mřížku celočíselných žetonů, jako je slovník vizuálních stavebních bloků. Během tréninku je velká část těchto tokenů zamaskována a Transformer se je naučí předvídat zpětně, což je podmíněno vložením textu ze zmrazeného velkého jazykového modelu (T5-XXL). V době generace začíná Muse ze zcela maskované mřížky a dekóduje v paralelních kolech, předpovídá mnoho žetonů na krok a přemaskuje ty nejméně spolehlivé. Dvoustupňový návrh nejprve vytvoří mřížku tokenů s nízkým rozlišením, poté model s vysokým rozlišením vyplní mřížku s vyšším rozlišením. Vzhledem k tomu, že se současně rozlišují desítky tokenů, modely s parametry 900M a 3B produkují obraz s 256 nebo 512 pixely pouze v několika dopředných průchodech.
Technický přehled
Základním trikem je paralelní dekódování s remaskováním založeným na spolehlivosti, často nazývané vzorkování ve stylu MaskGIT. Namísto predikce jednoho tokenu po druhém (autoregresivní) nebo stonásobného odšumování (difúze), Muse předpovídá všechny maskované tokeny, ponechá si ty nejjistější a zbytek znovu zamaskuje pro další kolo. Použití zamrzlého textového kodéru T5-XXL poskytuje bezplatně silné jazykové porozumění a provoz s diskrétními tokeny umožňuje modelu uvažovat o obrázcích spíše jako o slovech.
Strategický dopad
Rychlost a měřítko
Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.
Volby sestavy
Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.
Tým a pracovní postup
Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.
Budoucnost Muse Masked Generative Imaging
Maskované paralelní dekódování směřuje ke generátorům, které jsou vysoce kvalitní a skutečně rychlé, což je nezbytné pro interaktivní úpravy a použití na zařízení. Očekávejte, že se myšlenka token-prediction spojí s difúzními a autoregresivními metodami videa a že bude moci okamžité malování, překreslování a úpravy bez masky. Jak se zdokonalují diskrétní tokenizéry, maskované zobrazování se může čistě rozšířit do videa a 3D, kde by paralelní dekódování mohlo dramaticky snížit náklady na generování mnoha snímků nebo zobrazení.
Real-World Implementace
Rychlý koncept art a náladové nástěnky, kde umělec potřebuje mnoho variací obrazu během několika sekund, nikoli minut.
Vykreslování s nulovým záběrem, jako je odstranění objektu a ponechání modelu vyplnění maskované oblasti konzistentně s okolím.
Přemalování pro rozšíření fotografie za její původní hranice pro bannery nebo různé poměry stran.
Úpravy bez masky, jako je změna barvy psa nebo oblohy na západ slunce úpravou textové výzvy a překódováním dotčených tokenů.
Rizika a zábradlí
Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.
Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.
Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.
Plán implementace
Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.
Testujte s daty, která odpovídají reálným výrobním podmínkám.
Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.
Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Maskované automatické kodéry
Často kladené otázky
What is Muse Masked Generative Imaging?
Muse je model převodu textu na obrázek od Google, který generuje obrázky vyplněním maskovaných obrazových tokenů najednou, takže je mnohem rychlejší než postupné šíření. Záleží na tom, protože to ukázalo, že můžete získat vysoce kvalitní, dobře zarovnané obrázky bez pomalého iterativního odšumování, na které spoléhá většina generátorů.
Co Muse předpovídá během generování namísto odšumování pixelů?
Muse pracuje v diskrétním prostoru tokenů a předpovídá maskované tokeny obrázků vytvořené tokenizérem VQGAN, spíše než přímo pracuje s pixely.
Proč je Muse obecně rychlejší než standardní difúzní modely?
Muse vyplňuje mnoho maskovaných tokenů současně a potřebuje pouze několik dekódovacích kol, na rozdíl od mnoha sekvenčních kroků odšumování v difusion.
Odkud Muse rozumí textové výzvě?
Muse podmiňuje generování textových vložení ze zmrazeného předtrénovaného jazykového modelu T5-XXL, což mu dává silné jazykové porozumění.
Jaká je role remaskování založeného na důvěře v Muse?
Po každé paralelní predikci si Muse ponechá nejjistější žetony a přemaskuje ty nejméně sebevědomé, aby je v následujících kolech vylepšil.
Jak Muse zvládá vytváření obrázků ve vyšším rozlišení?
Muse nejprve vygeneruje mřížku tokenů s nízkým rozlišením, poté druhý model se super rozlišením vytvoří mřížku tokenů s vyšším rozlišením.