Visuele AI-GIDS

Latente diffusiemodellen

Latente diffusiemodellen genereren beelden door het diffusieproces uit te voeren in een gecomprimeerde latente ruimte in plaats van in ruwe pixels, waardoor de rekenkosten dalen.

2 min readLaatst bijgewerkt

Overzicht

They are the engine behind Stable Diffusion and most modern open-source image generators.

Diepe duik

Een standaard diffusiemodel leert een ruisproces om te keren: het begint met pure ruis en ontdoet geleidelijk de ruis tot een beeld. Dit rechtstreeks op pixels doen is duur omdat een afbeelding van 512x512 honderdduizenden waarden heeft. Latente diffusie, geïntroduceerd door Rombach en collega's in 2022, maakt eerst gebruik van een vooraf getrainde Variational Autoencoder (VAE) om een ​​afbeelding te comprimeren tot een klein latent raster (vaak 64x64x4, ongeveer 48x kleiner). De diffusie U-Net leert vervolgens ruis te denoise binnen die compacte latente ruimte, geleid door tekst via kruis-aandacht. Ten slotte reconstrueert de VAE-decoder pixels met volledige resolutie. Deze perceptuele compressie behoudt de semantisch betekenisvolle informatie terwijl onmerkbare details worden weggegooid, waardoor hoogwaardige generatie mogelijk wordt gemaakt op consumenten-GPU's.

Technisch inzicht

De belangrijkste truc is het scheiden van perceptuele compressie en generatieve modellering. De VAE verwerkt het hoogfrequente pixeldetail één keer, en het U-Net modelleert alleen de lager-dimensionale latente distributie. Tekstconditionering wordt geïnjecteerd via lagen met meerdere aandacht, waarbij de ruimtelijke kenmerken van het U-Net zorgen voor token-inbedding van een tekst-encoder zoals CLIP. Omdat de latenten grofweg 48 keer kleiner zijn dan pixels, is elke stap voor het verwijderen van ruis dramatisch goedkoper in zowel geheugen als FLOP's.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van latente diffusiemodellen

Latente diffusie breidt zich verder uit dan alleen afbeeldingen naar video (Stable Video Diffusion), 3D-middelen en audiospectrogrammen, allemaal met behulp van hetzelfde recept voor comprimeren en vervolgens denoise. Onderzoek streeft naar minder bemonsteringsstappen via destillatie- en consistentiemodellen, betere VAE's die fijne tekst en gezichten behouden, en rectified-flow-formuleringen zoals die in Stable Diffusion 3 die het generatietraject rechttrekken voor snellere, scherpere resultaten.

Implementatie in de echte wereld

Stabiele diffusie die illustraties en conceptontwerpen genereert op basis van tekstprompts op één enkele consumenten-GPU

Adobe en Canva bieden functies voor tekst-naar-afbeelding en generatieve vulling, gebouwd op latente diffusie-backbones

Gamestudio's die textuurkaarten, sprites en omgevingsconceptkunst produceren om de pre-productie te versnellen

Stock-image- en marketingteams die productmodellen en advertentiebeelden op het merk creëren zonder een fotoshoot

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Videoverspreidingsmodellen

Frequently asked questions

What is Latent Diffusion Models?

Latente diffusiemodellen genereren beelden door het diffusieproces uit te voeren in een gecomprimeerde latente ruimte in plaats van in ruwe pixels, waardoor de rekenkosten dalen. Zij zijn de motor achter Stable Diffusion en de meeste moderne open-source beeldgeneratoren.

Wat is de belangrijkste innovatie van latente diffusiemodellen vergeleken met pixel-ruimte-diffusie?

Latente diffusie comprimeert beelden in een kleinere latente ruimte met behulp van een VAE, zodat de dure ruisonderdrukking plaatsvindt bij veel minder waarden dan bij volledige pixels.

Welke component comprimeert een beeld in de latente ruimte en reconstrueert het daarna?

Een vooraf getrainde VAE codeert het beeld in een compact latent raster en de decoder reconstrueert aan het eind pixels met volledige resolutie.

Hoe wordt tekst doorgaans in latente verspreiding in het ruisonderdrukkende U-Net geïnjecteerd?

Token-insluitingen van een tekst-encoder worden in lagen met meerdere aandachtsgebieden ingevoerd, waardoor ruimtelijke kenmerken de prompt kunnen volgen.

Waarom verlaagt het werken in latente ruimte de rekenkosten?

Wacht - de juiste reden is dat het latente raster veel kleiner is (vaak ~48x) dan het pixelbeeld, dus elke stap voor het verwijderen van ruis heeft veel minder FLOP's en geheugen nodig.

Welk veelgebruikte open-sourcemodel heeft latente diffusie gepopulariseerd?

Stable Diffusion, uitgebracht in 2022, zorgde voor latente verspreiding naar consumentenhardware en massale adoptie.