Diffusjonstransformatorer
Diffusion Transformers (DiTs) bytter ut det konvolusjonelle U-nettet i hjertet av bilde- og videogeneratorer med en transformator-ryggrad.
Oversikt
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
Dypdykk
Diffusjonsmodeller genererer bilder ved å starte fra ren støy og iterativt forynge det til et sammenhengende bilde. I årevis var nettverket som gjorde den fornektelsen et U-Net, en konvolusjonsarkitektur. Diffusion Transformer, introdusert av Peebles og Xie i 2022, erstatter U-Net med en Transformer. Bildet blir først komprimert til et latent rom, delt opp i små flekker, og hver lapp blir et symbol, omtrent som ord i en språkmodell. Transformatoren behandler deretter disse tokens med selvoppmerksomhet ved hvert deoising-trinn. Et sentralt funn var at DiT-ytelsen forbedres forutsigbart når du øker modellstørrelsen og reduserer oppdateringsstørrelsen, i henhold til lover om ren skalering. Denne skalerbarheten er grunnen til at tekst-til-video og avanserte tekst-til-bilde-systemer i stor grad har migrert til Transformer-ryggrad.
Teknisk innsikt
En kjerneinnovasjon er hvordan DiTs injiserer kondisjonering som tidstrinn og tekstmelding. I stedet for enkel sammenkobling bruker de adaptiv lagnormalisering (adaLN), der nettverket forutsier skala- og skiftparametere for normaliseringslag fra kondisjoneringssignalet. adaLN-null-varianten initialiserer disse slik at hver blokk starter som en identitetsfunksjon som stabiliserer trening. Lapper blir flatet sammen til tokens, behandlet av standard Transformer-blokker med selvoppmerksomhet, deretter satt sammen og dekodet tilbake til piksler.
Strategisk innvirkning
Speed and scale
Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.
Build choices
Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.
Team and workflow
Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.
Fremtiden til diffusjonstransformatorer
Diffusjonstransformatorer er i ferd med å bli standard ryggraden for generative medier. Deres token-baserte design gjør dem naturlige for å forene bilder, video og til og med multimodal generasjon under én skalerbar arkitektur. Forskning presser mot lengre video, høyere oppløsning og mer effektiv oppmerksomhet for å temme den kvadratiske kostnaden for mange tokens. Forvent konvergens mellom språk- og visjonsmodeller, der lignende Transformer-skaleringsoppskrifter og infrastruktur tjener begge deler, og akselererer fremgang i verdensmodeller og interaktiv video.
Real-World Implementering
OpenAIs Sora bruker en Transformer-ryggrad over romtidsoppdateringer for å generere minuttlange, hi-fi-videoer fra tekstmeldinger.
Stable Diffusion 3 tar i bruk en multimodal diffusjonstransformator (MMDiT) for bedre å justere genererte bilder med detaljerte tekstbeskrivelser.
Forskere skalerer en DiT til milliarder av parametere og observerer at bildekvaliteten forbedres forutsigbart, og styrer beslutninger om beregning av budsjett.
Et studio bruker en DiT-basert modell for å forlenge korte klipp, og behandler ekstra videorammer som ekstra patch-tokens for denoise.
Risikoer og rekkverk
Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.
Modellytelsen kan variere på tvers av belysning, demografi og miljøer.
Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.
Veikart for implementering
Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.
Test med data som samsvarer med reelle produksjonsforhold.
Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.
Spor modelldrift og revalider etter endringer i kamera eller datasett.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Romlige transformatornettverk
Ofte stilte spørsmål
What is Diffusion Transformers?
Diffusion Transformers (DiTs) bytter ut det konvolusjonelle U-nettet i hjertet av bilde- og videogeneratorer med en transformator-ryggrad. Denne arkitekturen driver ledende systemer som Stable Diffusion 3 og OpenAIs Sora, og den skaleres bemerkelsesverdig godt når du legger til databehandling.
Hvilken komponent erstatter en diffusjonstransformator sammenlignet med tradisjonelle diffusjonsmodeller?
DiT-er erstatter U-Net, det konvolusjonelle nettverket som utførte denoising, med en Transformer-ryggrad.
Hvordan gjør en DiT et bilde til noe en transformator kan behandle?
Det latente bildet er delt inn i små flekker, og hver lapp blir et symbol, analogt med ord i en språkmodell.
Hva fant det originale DiT-papiret om skalering?
DiT-kvaliteten forbedres på en ren, forutsigbar måte når du øker modellberegningen og bruker mindre oppdateringer, etter skaleringslover.
Hvordan injiserer DiT-er vanligvis kondisjonering som tidstrinn og tekstmelding?
DiT-er bruker adaptiv lagnormalisering for å forutsi skala og skifte parametere for normaliseringslag fra kondisjoneringssignalet.
Hva oppnår initialiseringen 'adaLN-null'?
adaLN-zero initialiserer moduleringen slik at hver blokk i utgangspunktet fungerer som identitet, noe som stabiliserer og forbedrer treningen.