GUIDA AI visiva

Trasformatori di diffusione

I Diffusion Transformers (DiT) sostituiscono la U-Net convoluzionale nel cuore dei generatori di immagini e video con un backbone Transformer.

2 minuti di letturaUltimo aggiornamento

Panoramica

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

Immersione profonda

I modelli di diffusione generano immagini partendo dal rumore puro e riducendolo iterativamente in un'immagine coerente. Per anni la rete che effettuava tale denoising era una U-Net, un'architettura convoluzionale. Il Diffusion Transformer, introdotto da Peebles e Xie nel 2022, sostituisce U-Net con un trasformatore. L'immagine viene prima compressa in uno spazio latente, divisa in piccole porzioni e ciascuna porzione diventa un token, proprio come le parole in un modello linguistico. Il Trasformatore elabora quindi questi token con auto-attenzione ad ogni fase di denoising. Una scoperta fondamentale è stata che le prestazioni DiT migliorano in modo prevedibile man mano che si aumentano le dimensioni del modello e si riducono le dimensioni delle patch, seguendo le leggi di scalabilità pulita. Questa scalabilità è il motivo per cui i sistemi text-to-video e text-to-image di fascia alta sono in gran parte migrati verso i backbone Transformer.

Approfondimento tecnico

Un'innovazione fondamentale è il modo in cui i DiT inseriscono condizionamenti come il timestep e il messaggio di testo. Invece della semplice concatenazione, utilizzano la normalizzazione dello strato adattivo (adaLN), in cui la rete prevede i parametri di scala e spostamento per gli strati di normalizzazione dal segnale di condizionamento. La variante adaLN-zero li inizializza in modo che ogni blocco inizi come una funzione di identità, stabilizzando l'addestramento. Le patch vengono appiattite in token, elaborate da blocchi Transformer standard con auto-attenzione, quindi riassemblate e decodificate nuovamente in pixel.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro dei trasformatori a diffusione

I trasformatori di diffusione stanno diventando la spina dorsale predefinita per i media generativi. Il loro design basato su token li rende naturali per unificare immagini, video e persino la generazione multimodale sotto un'unica architettura scalabile. La ricerca sta spingendo verso video più lunghi, una risoluzione più elevata e un’attenzione più efficiente per domare il costo quadratico di molti token. Aspettatevi una convergenza tra modelli linguistici e di visione, in cui ricette e infrastrutture simili di scalabilità di Transformer servono entrambi, accelerando il progresso nei modelli mondiali e nei video interattivi.

Implementazione nel mondo reale

Sora di OpenAI utilizza un backbone Transformer su patch spaziotemporali per generare video ad alta fedeltà della durata di un minuto da istruzioni di testo.

Stable Diffusion 3 adotta un trasformatore di diffusione multimodale (MMDiT) per allineare meglio le immagini generate con descrizioni di testo dettagliate.

I ricercatori adattano un DiT a miliardi di parametri e osservano il miglioramento prevedibile della qualità dell'immagine, guidando le decisioni sul budget di calcolo.

Uno studio utilizza un modello basato su DiT per estendere brevi clip, trattando i fotogrammi video aggiuntivi come token di patch aggiuntivi da eliminare.

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Reti di trasformatori spaziali

Domande frequenti

What is Diffusion Transformers?

I Diffusion Transformers (DiT) sostituiscono la U-Net convoluzionale nel cuore dei generatori di immagini e video con un backbone Transformer. Questa architettura è alla base di sistemi leader come Stable Diffusion 3 e Sora di Sora e si adatta notevolmente bene man mano che si aggiunge l'elaborazione.

Quale componente sostituisce un Trasformatore di Diffusione rispetto ai tradizionali modelli di diffusione?

I DiT sostituiscono U-Net, la rete convoluzionale che esegue il denoising, con un backbone Transformer.

In che modo un DiT trasforma un'immagine in qualcosa che un Transformer può elaborare?

L'immagine latente è divisa in piccole macchie, e ciascuna macchia diventa un token, analogo alle parole in un modello linguistico.

Cosa ha scoperto il documento DiT originale riguardo al ridimensionamento?

La qualità DiT migliora in modo chiaro e prevedibile man mano che si aumenta il calcolo del modello e si utilizzano patch più piccole, seguendo le leggi di dimensionamento.

In che modo i DiT in genere inseriscono condizionamenti come il timestep e il messaggio di testo?

I DiT utilizzano la normalizzazione dello strato adattivo per prevedere la scala e lo spostamento dei parametri per gli strati di normalizzazione dal segnale di condizionamento.

Cosa comporta l'inizializzazione "adaLN-zero"?

adaLN-zero inizializza la modulazione in modo che ogni blocco agisca inizialmente come identità, il che stabilizza e migliora la formazione.