Modely latentní difúze
Modely latentní difúze generují obrazy spuštěním procesu difúze v komprimovaném latentním prostoru namísto nezpracovaných pixelů, což snižuje náklady na výpočet.
Přehled
They are the engine behind Stable Diffusion and most modern open-source image generators.
Hluboký ponor
Standardní difúzní model se učí zvrátit proces šumu: začíná od čistého šumu a postupně se odšumuje do obrazu. Dělat to přímo na pixelech je drahé, protože obrázek 512x512 má statisíce hodnot. Latentní difúze, kterou představil Rombach a kolegové v roce 2022, nejprve používá předtrénovaný variační autoencodér (VAE) ke kompresi obrazu do malé latentní mřížky (často 64x64x4, zhruba 48x menší). Difúzní U-Net se pak naučí odšumovat uvnitř tohoto kompaktního latentního prostoru, vedena textem prostřednictvím křížové pozornosti. Nakonec dekodér VAE rekonstruuje pixely v plném rozlišení. Tato percepční komprese zachovává sémanticky smysluplné informace a zároveň odstraňuje nepostřehnutelné detaily, což umožňuje vysoce kvalitní generování na spotřebitelských GPU.
Technický přehled
Klíčovým trikem je oddělení percepční komprese od generativního modelování. VAE zpracovává vysokofrekvenční pixelové detaily jednou a U-Net modeluje pouze distribuci latentního očního stínu v nižších rozměrech. Úprava textu je aplikována prostřednictvím vrstev křížové pozornosti, kde se prostorové prvky U-Net starají o vkládání tokenů z textového kodéru, jako je CLIP. Vzhledem k tomu, že latentní prvky jsou zhruba 48krát menší než pixely, je každý krok odstranění šumu výrazně levnější jak v paměti, tak v FLOP.
Strategický dopad
Rychlost a měřítko
Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.
Volby sestavy
Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.
Tým a pracovní postup
Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.
Budoucnost modelů latentní difúze
Latentní difúze se rozšiřuje za obrázky do videa (Stable Video Diffusion), 3D aktiv a zvukových spektrogramů, přičemž všechny používají stejný recept na kompresi a poté odšumování. Výzkum tlačí směrem k menšímu počtu kroků vzorkování prostřednictvím modelů destilace a konzistence, lepších VAE, které zachovávají jemný text a obličeje, a formulací s rektifikovaným tokem, jako jsou ty ve Stable Diffusion 3, které narovnávají generační trajektorii pro rychlejší a ostřejší výsledky.
Real-World Implementace
Stabilní difúze generující umělecká díla a návrhy konceptů z textových výzev na jediném spotřebitelském GPU
Adobe a Canva využívající funkce převodu textu na obrázek a generativního vyplňování postavené na páteřích latentní difúze
Herní studia produkující texturové mapy, sprity a koncepty prostředí pro urychlení předprodukce
Stock-image a marketingové týmy vytvářející makety produktů značky a vizuály reklam bez focení
Rizika a zábradlí
Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.
Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.
Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.
Plán implementace
Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.
Testujte s daty, která odpovídají reálným výrobním podmínkám.
Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.
Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Modely šíření videa
Často kladené otázky
What is Latent Diffusion Models?
Modely latentní difúze generují obrazy spuštěním procesu difúze v komprimovaném latentním prostoru namísto nezpracovaných pixelů, což snižuje náklady na výpočet. Jsou motorem Stable Diffusion a nejmodernějšími generátory obrázků s otevřeným zdrojovým kódem.
Jaká je hlavní inovace modelů latentní difúze ve srovnání s difuzí v pixelovém prostoru?
Latentní difúze komprimuje obrazy do menšího latentního prostoru pomocí VAE, takže drahé odstranění šumu se děje na mnohem menším počtu hodnot než na plných pixelech.
Která komponenta komprimuje obraz do latentního prostoru a následně jej rekonstruuje?
Předtrénovaný VAE zakóduje obraz do kompaktní latentní mřížky a jeho dekodér na konci rekonstruuje pixely v plném rozlišení.
Jak je text typicky vstřikován do odšumovací U-Net v latentní difúzi?
Vložení tokenů z textového kodéru se přivádí do vrstev pro křížovou pozornost, což umožňuje prostorovým prvkům věnovat pozornost výzvě.
Proč provoz v latentním prostoru snižuje výpočetní náklady?
Počkejte – správným důvodem je, že latentní mřížka je mnohem menší (často ~48x) než obraz pixelů, takže každý krok odšumování potřebuje mnohem méně FLOPů a paměti.
Který široce používaný model s otevřeným zdrojovým kódem popularizoval latentní šíření?
Stable Diffusion, vydaný v roce 2022, přinesl latentní rozšíření do spotřebitelského hardwaru a masové přijetí.