GUIDA AI FONDAMENTALI

Modelli di diffusione

I modelli di diffusione generano immagini imparando a invertire un processo di rumore, trasformando passo dopo passo immagini statiche casuali in immagini dettagliate.

2 minuti di letturaUltimo aggiornamento

Panoramica

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Immersione profonda

Un modello di diffusione viene addestrato in due direzioni. Nel processo successivo, un'immagine pulita viene gradualmente danneggiata aggiungendo piccole quantità di rumore casuale finché non diventa puramente statica. Il modello poi impara il contrario: partendo dal rumore, ne prevede e rimuove un po’ ad ogni passaggio, ripetendo decine o centinaia di volte finché non emerge un’immagine nitida. Per renderlo controllabile, un messaggio di testo guida ogni fase di rimozione del rumore, quindi "un astronauta a cavallo" guida l'immagine statica verso quell'immagine. I sistemi moderni come Stable Diffusion eseguono questo processo in uno spazio latente compresso anziché su pixel grezzi, rendendolo molto più veloce. Rispetto ai GAN, i modelli di diffusione si addestrano in modo più stabile e producono una maggiore diversità, motivo per cui hanno superato i GAN come approccio dominante per la generazione di immagini di alta qualità intorno al 2022.

Approfondimento tecnico

Il trucco chiave è che la rete non deve mai generare un'immagine in un colpo solo; impara solo a prevedere il rumore aggiunto in un dato passaggio. Durante l'addestramento, una quantità nota di rumore viene aggiunta a un'immagine reale e al modello viene chiesto di stimare tale rumore; la differenza è l'errore di addestramento. Al momento della generazione, il modello sottrae ripetutamente il rumore previsto, rivelando gradualmente la struttura. Il condizionamento del testo viene introdotto tramite l'attenzione incrociata e la guida senza classificatore amplifica la forza con cui il prompt indirizza l'output.

Impatto strategico

Decisioni più chiare

Ti aiuta a separare le chiare affermazioni tecniche dal linguaggio di marketing.

Costo e budget

Puoi porre domande sull'implementazione migliore prima di spendere denaro o tempo.

Team e flusso di lavoro

I team con una comprensione condivisa prendono decisioni migliori su prodotti, politiche e apprendimento.

Il futuro dei modelli di diffusione

La diffusione è l'attuale stato dell'arte per la generazione di immagini e, sempre più, di video e audio, con strumenti come Sora che la estendono al movimento. La grande spinta è la velocità: tecniche come la distillazione e i modelli di consistenza mirano a ridurre centinaia di passaggi di denoising a una manciata o addirittura uno, consentendo la generazione in tempo reale. Aspettatevi che la diffusione si espanda in risorse 3D, progettazione scientifica come molecole e proteine ​​e editing strettamente controllabile, diventando allo stesso tempo abbastanza economico da poter essere eseguito sui telefoni.

Implementazione nel mondo reale

Creazione di grafica e immagini originali da istruzioni di testo in Stable Diffusion, DALL-E e Midjourney

In-painting e outpainting, riempimento o estensione di parti di una foto senza soluzione di continuità

Generazione di video da testo in strumenti come Sora di OpenAI

Progettazione di nuove molecole e strutture proteiche per la ricerca sulla scoperta di farmaci

Rischi e guardrail

Team diversi possono utilizzare lo stesso termine in modo diverso, quindi definisci l'ambito in anticipo.

I benchmark possono sembrare solidi mentre le prestazioni nel mondo reale non sono uniformi.

Ignorare la qualità dei dati e i piani di valutazione spesso crea risultati fragili.

Tabella di marcia per l'implementazione

1

Inizia con una definizione in linguaggio semplice del risultato di cui hai bisogno.

2

Scegli una metrica di successo e una condizione di fallimento prima del test.

3

Esegui un piccolo progetto pilota con dati rappresentativi, non un set demo raffinato.

4

Documenta dove i modelli di diffusione aiutano e dove i metodi più semplici sono migliori.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Modello di diffusione GLIDE

Domande frequenti

What is Diffusion Models?

I modelli di diffusione generano immagini imparando a invertire un processo di rumore, trasformando passo dopo passo immagini statiche casuali in immagini dettagliate. Sono alla base dei principali strumenti di conversione testo-immagine di oggi, come Stable Diffusion, DALL-E e Midjourney.

Qual è l'idea centrale dietro il modo in cui un modello di diffusione genera un'immagine?

Un modello di diffusione impara a invertire un processo di rumore, partendo dal rumore puro e rimuovendo il rumore passo dopo passo finché non appare un'immagine chiara.

Durante l'addestramento, cosa impara effettivamente il modello a prevedere in ogni passaggio?

Al modello viene fornita un'immagine rumorosa e impara a stimare il rumore aggiunto, in modo da poterlo successivamente sottrarre durante la generazione.

In che modo un messaggio di testo influenza l'immagine generata?

Il condizionamento del testo (tramite attenzione incrociata e guida) favorisce ogni passaggio di denoising in modo che l'immagine emergente corrisponda al prompt.

Perché Stable Diffusion esegue il processo in uno "spazio latente"?

Operare in uno spazio latente compresso invece che in pixel a piena risoluzione riduce drasticamente il calcolo preservando la qualità.

Qual è un vantaggio chiave dei modelli di diffusione rispetto ai GAN?

I modelli di diffusione evitano il gioco contraddittorio instabile e il collasso delle modalità dei GAN, offrendo una formazione più affidabile e una maggiore varietà di output.