GHID AI vizual

Transformatoare de difuzie

Transformatoarele de difuzie (DiTs) schimbă U-Netul convoluțional din inima generatoarelor de imagini și video cu o coloană vertebrală Transformer.

2 minute de lecturăUltima actualizare

Prezentare generală

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

Scufundare în profunzime

Modelele de difuzie generează imagini pornind de la zgomotul pur și dezgomotul iterativ într-o imagine coerentă. De ani de zile, rețeaua care făcea această dezgomot a fost o U-Net, o arhitectură convoluțională. Diffusion Transformer, introdus de Peebles și Xie în 2022, înlocuiește U-Net cu un Transformer. Imaginea este mai întâi comprimată într-un spațiu latent, împărțită în mici petice, iar fiecare patch devine un simbol, la fel ca cuvintele dintr-un model de limbă. Transformerul procesează apoi aceste jetoane cu atenție personală la fiecare pas de eliminare a zgomotului. O constatare cheie a fost că performanța DiT se îmbunătățește previzibil pe măsură ce creșteți dimensiunea modelului și reduceți dimensiunea patch-urilor, urmând legile de scalare curată. Această scalabilitate este motivul pentru care sistemele text-to-video și high-end text-to-image au migrat în mare parte către coloana vertebrală Transformer.

Perspectivă tehnică

O inovație de bază este modul în care DiT-urile injectează condiționări precum intervalul de timp și promptul text. Mai degrabă decât simpla concatenare, ele folosesc normalizarea stratului adaptiv (adaLN), unde rețeaua prezice parametrii de scară și deplasare pentru straturile de normalizare din semnalul de condiționare. Varianta adaLN-zero le inițializează astfel încât fiecare bloc începe ca o funcție de identitate, stabilizând antrenamentul. Patch-urile sunt aplatizate în jetoane, procesate de blocuri Transformer standard cu atenție personală, apoi reasamblate și decodificate înapoi în pixeli.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul transformatoarelor de difuzie

Transformatoarele de difuzie devin coloana vertebrală implicită pentru mediile generative. Designul lor bazat pe token le face naturale pentru unificarea imaginilor, videoclipurilor și chiar generarea multimodală sub o arhitectură scalabilă. Cercetările se îndreaptă către videoclipuri mai lungi, rezoluție mai mare și o atenție mai eficientă pentru a diminua costul pătratic al multor jetoane. Așteptați-vă la convergența dintre modelele de limbaj și viziune, unde rețetele și infrastructura similare de scalare Transformer le servesc pe ambele, accelerând progresul în modelele mondiale și video interactiv.

Implementare în lumea reală

OpenAI Sora folosește o coloană vertebrală Transformer peste patch-uri spațiu-timp pentru a genera videoclipuri de înaltă fidelitate, de un minut, din mesaje text.

Stable Diffusion 3 adoptă un transformator de difuzie multimodal (MMDiT) pentru a alinia mai bine imaginile generate cu descrierile detaliate ale textului.

Cercetătorii scalează un DiT la miliarde de parametri și observă că calitatea imaginii se îmbunătățește în mod previzibil, ghidând deciziile privind bugetul de calcul.

Un studio folosește un model bazat pe DiT pentru a extinde clipurile scurte, tratând cadrele video suplimentare ca jetoane de corecție suplimentare pentru a reduce zgomotul.

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Rețele de transformatoare spațiale

Întrebări frecvente

What is Diffusion Transformers?

Transformatoarele de difuzie (DiTs) schimbă U-Netul convoluțional din inima generatoarelor de imagini și video cu o coloană vertebrală Transformer. Această arhitectură alimentează sisteme de vârf precum Stable Diffusion 3 și OpenAI's Sora și se scalează remarcabil de bine pe măsură ce adăugați calcul.

Ce componentă înlocuiește un transformator de difuzie în comparație cu modelele tradiționale de difuzie?

DiT-urile înlocuiesc U-Net, rețeaua convoluțională care a efectuat eliminarea zgomotului, cu o coloană vertebrală Transformer.

Cum transformă un DiT o imagine în ceva pe care un transformator poate procesa?

Imaginea latentă este împărțită în mici petice, iar fiecare patch devine un simbol, analog cuvintelor dintr-un model de limbaj.

Ce a găsit documentul original DiT despre scalare?

Calitatea DiT se îmbunătățește într-un mod curat și previzibil pe măsură ce creșteți calcularea modelului și utilizați patch-uri mai mici, respectând legile de scalare.

Cum injectează în mod obișnuit DiT-urile condiționări precum intervalul de timp și promptul text?

DiT-urile folosesc normalizarea adaptivă a stratului pentru a prezice parametrii de scară și deplasare pentru straturile de normalizare din semnalul de condiționare.

Ce realizează inițializarea „adaLN-zero”?

adaLN-zero inițializează modulația, astfel încât fiecare bloc să acționeze inițial ca identitate, ceea ce stabilizează și îmbunătățește antrenamentul.