Visual AI GUIDE

Latent diffusionsmodeller

Latenta diffusionsmodeller genererar bilder genom att köra diffusionsprocessen i ett komprimerat latent utrymme istället för råpixlar, vilket minskar beräkningskostnaderna.

2 min readSenast uppdaterad

Översikt

They are the engine behind Stable Diffusion and most modern open-source image generators.

Djupdykning

En standarddiffusionsmodell lär sig att vända en brusprocess: den börjar från rent brus och försvinner gradvis till en bild. Att göra detta direkt på pixlar är dyrt eftersom en 512x512 bild har hundratusentals värden. Latent diffusion, som introducerades av Rombach och kollegor 2022, använder först en förtränad variationsautokodare (VAE) för att komprimera en bild till ett litet latent rutnät (ofta 64x64x4, ungefär 48x mindre). Diffusionen U-Net lär sig sedan att försvaga inuti det kompakta latenta utrymmet, styrt av text via korsuppmärksamhet. Slutligen rekonstruerar VAE-avkodaren pixlar med full upplösning. Denna perceptuella komprimering behåller den semantiskt meningsfulla informationen samtidigt som den förkastar omärkliga detaljer, vilket gör högkvalitativ generering möjlig på konsument-GPU:er.

Teknisk insikt

Det viktigaste tricket är att skilja perceptuell komprimering från generativ modellering. VAE hanterar den högfrekventa pixeldetaljen en gång, och U-Net modellerar bara den lägre dimensionella latenta distributionen. Textkonditionering injiceras genom korsuppmärksamhetslager, där U-Nets rumsliga funktioner tar hand om tokeninbäddningar från en textkodare som CLIP. Eftersom latenterna är ungefär 48 gånger mindre än pixlar, är varje avbrusningssteg dramatiskt billigare i både minne och FLOP.

Strategisk inverkan

Speed and scale

Visual AI kan automatisera inspektion, upptäckt och taggningsuppgifter i stor skala.

Build choices

Kreativa team kan prototypa koncept snabbare med färre manuella revisioner.

Team and workflow

Operationer kan använda bild- och videosignaler som tidigare var svåra att bearbeta.

Framtiden för latenta diffusionsmodeller

Latent diffusion expanderar bortom bilder till video (Stable Video Diffusion), 3D-tillgångar och ljudspektrogram, allt med samma komprimera-sedan-denoise-recept. Forskning driver mot färre provtagningssteg via destillations- och konsistensmodeller, bättre VAEs som bevarar fin text och ytor, och korrigerade flödesformuleringar som de i Stable Diffusion 3 som rätar ut generationsbanan för snabbare, skarpare resultat.

Real-World Implementation

Stabil diffusionsgenererande konstverk och konceptdesigner från textmeddelanden på en enda konsument-GPU

Adobe och Canva driver text-till-bild och generativa fyllningsfunktioner byggda på latent spridningsryggrad

Spelstudior som producerar texturkartor, sprites och miljökonceptkonst för att påskynda förproduktionen

Lagerbilds- och marknadsföringsteam skapar produktmodeller och annonsbilder utan en fotografering

Risker & skyddsräcken

Bildrättigheter och samtycke kan bli juridiska risker om härkomst är oklart.

Modellens prestanda kan variera mellan belysning, demografi och miljöer.

Falska positiva resultat kan gå obemärkt förbi om inte konfidensgränser övervakas.

Färdplan för genomförande

1

Definiera acceptanskriterier för precision, återkallelse och felkostnader.

2

Testa med data som matchar verkliga produktionsförhållanden.

3

Lägg till mänsklig granskning för lågt förtroende eller förutsägelser med stor inverkan.

4

Spåra modelldrift och återvalidera efter ändringar av kamera eller datauppsättning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Videodiffusionsmodeller

Frequently asked questions

What is Latent Diffusion Models?

Latenta diffusionsmodeller genererar bilder genom att köra diffusionsprocessen i ett komprimerat latent utrymme istället för råpixlar, vilket minskar beräkningskostnaderna. De är motorn bakom Stable Diffusion och de flesta moderna bildgeneratorer med öppen källkod.

Vad är den främsta innovationen med latenta diffusionsmodeller jämfört med pixel-space diffusion?

Latent diffusion komprimerar bilder till ett mindre latent utrymme med hjälp av en VAE, så den dyra avbrusningen sker på mycket färre värden än hela pixlar.

Vilken komponent komprimerar en bild i det latenta rummet och rekonstruerar den efteråt?

En förtränad VAE kodar bilden till ett kompakt latent rutnät och dess avkodare rekonstruerar fullupplösta pixlar i slutet.

Hur injiceras text vanligtvis i det försvagande U-nätet i latent diffusion?

Tokeninbäddningar från en textkodare matas in i korsuppmärksamhetslager, vilket låter rumsliga funktioner sköta prompten.

Varför minskar driften i latent utrymme beräkningskostnaderna?

Vänta — det korrekta skälet är att det latenta rutnätet är mycket mindre (ofta ~48x) än pixelbilden, så varje avbrusningssteg behöver mycket färre FLOP:ar och minne.

Vilken allmänt använd öppen källkodsmodell populariserade latent diffusion?

Stable Diffusion, som släpptes 2022, gav latent spridning till konsumenthårdvara och massintroduktion.