Vizuális MI ÚTMUTATÓ

Diffúziós transzformátorok

A diffúziós transzformátorok (DiTs) felcserélik a kép- és videógenerátorok középpontjában álló konvolúciós U-Netet egy Transformer gerincre.

2 perc olvasásUtoljára frissítve

Áttekintés

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

Mély merülés

A diffúziós modellek úgy állítanak elő képeket, hogy tiszta zajból indulnak ki, és iteratív módon zajtalanítják azt koherens képpé. Évekig a zajcsökkentést végző hálózat U-Net volt, egy konvolúciós architektúra. A Peebles és Xie által 2022-ben bemutatott Diffusion Transformer az U-Netet egy Transformerre cseréli. A képet először egy látens térbe tömörítik, kis foltokra osztják, és minden folt egy token lesz, hasonlóan a nyelvi modell szavaihoz. A Transformer ezután minden zajtalanítási lépésnél önfigyeléssel dolgozza fel ezeket a tokeneket. A legfontosabb megállapítás az volt, hogy a DiT teljesítmény előre láthatóan javul a modell méretének növelésével és a patch méretének csökkentésével, követve a tiszta méretezési törvényeket. Ez a méretezhetőség az oka annak, hogy a szöveg-videó és a csúcskategóriás szöveg-kép rendszerek nagyrészt áttértek a Transformer gerinchálózatára.

Technikai betekintés

Az alapvető újítás az, ahogy a DiT-k olyan feltételeket injektálnak, mint az időlépés és a szöveges prompt. Az egyszerű összefűzés helyett adaptív rétegnormalizációt (adaLN) használnak, ahol a hálózat a kondicionáló jelből előrejelzi a normalizációs rétegek léptékét és eltolási paramétereit. Az adaLN-zero változat ezeket inicializálja, így minden blokk identitásfüggvényként indul, stabilizálja a képzést. A patch-eket tokenekké lapítják, szabványos Transformer blokkok önfigyeléssel dolgozzák fel, majd újra összeállítják és visszafejtik pixelekké.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A diffúziós transzformátorok jövője

A diffúziós transzformátorok a generatív adathordozók alapértelmezett gerincévé válnak. Token-alapú kialakításuk természetessé teszi őket a képek, videók és akár a multimodális generálás egy skálázható architektúra alatt történő egyesítésére. A kutatás a hosszabb videó, a nagyobb felbontás és a hatékonyabb figyelem felé törekszik, hogy megszelídítse számos token négyzetes költségét. Konvergenciára számíthatunk a nyelvi és látási modellek között, ahol a hasonló Transformer skálázási receptek és infrastruktúra mindkettőt szolgálja, felgyorsítva a világmodellek és az interaktív videók fejlődését.

Valós megvalósítás

A OpenAI Sora Transformer gerincét használja a téridő foltokon, hogy perchosszúságú, nagy hűségű videókat hozzon létre szöveges promptokból.

A Stable Diffusion 3 multimodális diffúziós transzformátort (MMDiT) alkalmaz, hogy jobban összehangolja a generált képeket a részletes szöveges leírásokkal.

A kutatók a DiT-t több milliárd paraméterre skálázzák, és megfigyelik, hogy a képminőség kiszámíthatóan javul, ami irányítja a számítási költségvetési döntéseket.

Egy stúdió DiT-alapú modellt használ a rövid klipek meghosszabbításához, és az extra videokockákat további patch tokenként kezeli a zajtalanítás érdekében.

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Térbeli transzformátor hálózatok

Gyakran ismételt kérdések

What is Diffusion Transformers?

A diffúziós transzformátorok (DiTs) felcserélik a kép- és videógenerátorok középpontjában álló konvolúciós U-Netet egy Transformer gerincre. Ez az architektúra olyan vezető rendszereket hajt végre, mint a Stable Diffusion 3 és a OpenAI Sora, és figyelemreméltóan jól skálázódik a számítások hozzáadásával.

Milyen alkatrészt helyettesít a diffúziós transzformátor a hagyományos diffúziós modellekhez képest?

A DiT-ek felváltják az U-Netet, a zajtalanítást végző konvolúciós hálózatot, Transformer gerinccel.

Hogyan változtat egy DiT egy képet olyasmivé, amit a Transformer képes feldolgozni?

A látens kép kis foltokra oszlik, és mindegyik folt jelzővé válik, hasonlóan a nyelvi modell szavaihoz.

Mit talált az eredeti DiT-papír a méretezésről?

A DiT minősége tiszta, kiszámítható módon javul, ahogy növeli a modellszámítást és kisebb foltokat használ, követve a méretezési törvényeket.

Hogyan alkalmazzák a DiT-ek a feltételeket, például az időlépést és a szöveges promptot?

A DiT-k adaptív rétegnormalizálást használnak a skálázási és eltolási paraméterek előrejelzésére a normalizálási rétegekhez a kondicionáló jelből.

Mit ér el az „adaLN-zero” inicializálás?

Az adaLN-zero inicializálja a modulációt, így minden blokk kezdetben identitásként működik, ami stabilizálja és javítja a képzést.