Difúzní transformátory
Diffusion Transformers (DiTs) vymění konvoluční U-Net v srdci generátorů obrazu a videa za páteř Transformer.
Přehled
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
Hluboký ponor
Difúzní modely generují obrazy tak, že začínají od čistého šumu a iterativně jej odšumují do koherentního obrazu. Po léta byla síť, která prováděla toto odšumování, U-Net, konvoluční architektura. Diffusion Transformer, který představili Peebles a Xie v roce 2022, nahrazuje U-Net transformátorem. Obraz je nejprve komprimován do latentního prostoru, rozdělen do malých políček a každá záplata se stává tokenem, podobně jako slova v jazykovém modelu. Transformátor pak tyto tokeny zpracovává s vlastní pozorností při každém kroku odšumování. Klíčovým zjištěním bylo, že výkon DiT se předvídatelně zlepšuje, když zvětšujete velikost modelu a zmenšujete velikost opravy, a to podle zákonů čistého škálování. Tato škálovatelnost je důvodem, proč systémy pro převod textu na video a špičkové systémy pro převod textu na obrázek z velké části migrovaly na páteřní sítě Transformer.
Technický přehled
Základní inovací je způsob, jakým DiTs vkládá úpravu, jako je časový krok a textová výzva. Spíše než jednoduché zřetězení používají normalizaci adaptivní vrstvy (adaLN), kdy síť předpovídá parametry měřítka a posunu pro normalizační vrstvy z kondicionačního signálu. Varianta adaLN-nula je inicializuje, takže každý blok začíná jako funkce identity, stabilizující trénink. Patche jsou sloučeny do tokenů, zpracovány standardními bloky Transformer s vlastní pozorností, poté znovu sestaveny a dekódovány zpět do pixelů.
Strategický dopad
Rychlost a měřítko
Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.
Volby sestavy
Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.
Tým a pracovní postup
Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.
Budoucnost difúzních transformátorů
Difúzní transformátory se stávají výchozí páteří pro generativní média. Jejich design založený na tokenech je činí přirozenými pro sjednocení obrázků, videa a dokonce i multimodální generování v rámci jedné škálovatelné architektury. Výzkum tlačí k delšímu videu, vyššímu rozlišení a efektivnější pozornosti ke zkrocení kvadratických nákladů mnoha tokenů. Očekávejte konvergenci mezi jazykovými a vizuálními modely, kde podobné škálovací receptury a infrastruktura Transformer slouží oběma, což urychluje pokrok ve světových modelech a interaktivním videu.
Real-World Implementace
OpenAI Sora využívá páteřní síť Transformer přes časoprostorové záplaty ke generování minutových, vysoce věrných videí z textových výzev.
Stable Diffusion 3 využívá multimodální difúzní transformátor (MMDiT) pro lepší zarovnání generovaných obrázků s podrobnými textovými popisy.
Výzkumníci škálují DiT na miliardy parametrů a pozorují, jak se kvalita obrazu předvídatelně zlepšuje, což vede k rozhodování o výpočetním rozpočtu.
Studio používá model založený na DiT k prodloužení krátkých klipů, přičemž další snímky videa jsou považovány za další tokeny záplat pro odstranění šumu.
Rizika a zábradlí
Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.
Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.
Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.
Plán implementace
Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.
Testujte s daty, která odpovídají reálným výrobním podmínkám.
Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.
Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Sítě prostorových transformátorů
Často kladené otázky
What is Diffusion Transformers?
Diffusion Transformers (DiTs) vymění konvoluční U-Net v srdci generátorů obrazu a videa za páteř Transformer. Tato architektura pohání přední systémy, jako je Stable Diffusion 3 a Sora OpenAI, a je pozoruhodně dobře škálovatelná, když přidáte výpočet.
Jakou součástku nahrazuje difúzní transformátor ve srovnání s tradičními difúzními modely?
DiTs nahrazují U-Net, konvoluční síť, která prováděla odšumování, páteří Transformer.
Jak DiT změní obrázek na něco, co dokáže Transformer zpracovat?
Latentní obraz je rozdělen do malých políček a každá záplata se stává tokenem, analogickým slovům v jazykovém modelu.
Co zjistil původní dokument DiT o škálování?
Kvalita DiT se zlepšuje čistým a předvídatelným způsobem, když zvyšujete výpočet modelu a používáte menší záplaty v souladu se zákony o škálování.
Jak DiTs obvykle aplikuje úpravu, jako je časový krok a textová výzva?
DiT používají adaptivní normalizaci vrstvy k predikci parametrů měřítka a posunu pro normalizační vrstvy z kondicionačního signálu.
Čeho dosáhne inicializace „adaLN-zero“?
adaLN-zero inicializuje modulaci, takže každý blok zpočátku funguje jako identita, která stabilizuje a zlepšuje trénink.