Vizuální průvodce AI

Modely latentní difúze

Modely latentní difúze generují obrazy spuštěním procesu difúze v komprimovaném latentním prostoru namísto nezpracovaných pixelů, což snižuje náklady na výpočet.

2 minuty čteníNaposledy aktualizováno

Přehled

They are the engine behind Stable Diffusion and most modern open-source image generators.

Hluboký ponor

Standardní difúzní model se učí zvrátit proces šumu: začíná od čistého šumu a postupně se odšumuje do obrazu. Dělat to přímo na pixelech je drahé, protože obrázek 512x512 má statisíce hodnot. Latentní difúze, kterou představil Rombach a kolegové v roce 2022, nejprve používá předtrénovaný variační autoencodér (VAE) ke kompresi obrazu do malé latentní mřížky (často 64x64x4, zhruba 48x menší). Difúzní U-Net se pak naučí odšumovat uvnitř tohoto kompaktního latentního prostoru, vedena textem prostřednictvím křížové pozornosti. Nakonec dekodér VAE rekonstruuje pixely v plném rozlišení. Tato percepční komprese zachovává sémanticky smysluplné informace a zároveň odstraňuje nepostřehnutelné detaily, což umožňuje vysoce kvalitní generování na spotřebitelských GPU.

Technický přehled

Klíčovým trikem je oddělení percepční komprese od generativního modelování. VAE zpracovává vysokofrekvenční pixelové detaily jednou a U-Net modeluje pouze distribuci latentního očního stínu v nižších rozměrech. Úprava textu je aplikována prostřednictvím vrstev křížové pozornosti, kde se prostorové prvky U-Net starají o vkládání tokenů z textového kodéru, jako je CLIP. Vzhledem k tomu, že latentní prvky jsou zhruba 48krát menší než pixely, je každý krok odstranění šumu výrazně levnější jak v paměti, tak v FLOP.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost modelů latentní difúze

Latentní difúze se rozšiřuje za obrázky do videa (Stable Video Diffusion), 3D aktiv a zvukových spektrogramů, přičemž všechny používají stejný recept na kompresi a poté odšumování. Výzkum tlačí směrem k menšímu počtu kroků vzorkování prostřednictvím modelů destilace a konzistence, lepších VAE, které zachovávají jemný text a obličeje, a formulací s rektifikovaným tokem, jako jsou ty ve Stable Diffusion 3, které narovnávají generační trajektorii pro rychlejší a ostřejší výsledky.

Real-World Implementace

Stabilní difúze generující umělecká díla a návrhy konceptů z textových výzev na jediném spotřebitelském GPU

Adobe a Canva využívající funkce převodu textu na obrázek a generativního vyplňování postavené na páteřích latentní difúze

Herní studia produkující texturové mapy, sprity a koncepty prostředí pro urychlení předprodukce

Stock-image a marketingové týmy vytvářející makety produktů značky a vizuály reklam bez focení

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Modely šíření videa

Často kladené otázky

What is Latent Diffusion Models?

Modely latentní difúze generují obrazy spuštěním procesu difúze v komprimovaném latentním prostoru namísto nezpracovaných pixelů, což snižuje náklady na výpočet. Jsou motorem Stable Diffusion a nejmodernějšími generátory obrázků s otevřeným zdrojovým kódem.

Jaká je hlavní inovace modelů latentní difúze ve srovnání s difuzí v pixelovém prostoru?

Latentní difúze komprimuje obrazy do menšího latentního prostoru pomocí VAE, takže drahé odstranění šumu se děje na mnohem menším počtu hodnot než na plných pixelech.

Která komponenta komprimuje obraz do latentního prostoru a následně jej rekonstruuje?

Předtrénovaný VAE zakóduje obraz do kompaktní latentní mřížky a jeho dekodér na konci rekonstruuje pixely v plném rozlišení.

Jak je text typicky vstřikován do odšumovací U-Net v latentní difúzi?

Vložení tokenů z textového kodéru se přivádí do vrstev pro křížovou pozornost, což umožňuje prostorovým prvkům věnovat pozornost výzvě.

Proč provoz v latentním prostoru snižuje výpočetní náklady?

Počkejte – správným důvodem je, že latentní mřížka je mnohem menší (často ~48x) než obraz pixelů, takže každý krok odšumování potřebuje mnohem méně FLOPů a paměti.

Který široce používaný model s otevřeným zdrojovým kódem popularizoval latentní šíření?

Stable Diffusion, vydaný v roce 2022, přinesl latentní rozšíření do spotřebitelského hardwaru a masové přijetí.