Verspreidingsmodellen
Diffusiemodellen genereren beelden door te leren een ruisproces om te keren, waarbij willekeurige statische beelden stap voor stap worden omgezet in gedetailleerde beelden.
Overzicht
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Diepe duik
Een diffusiemodel wordt in twee richtingen getraind. In het voorwaartse proces wordt een schoon beeld geleidelijk beschadigd door kleine hoeveelheden willekeurige ruis toe te voegen totdat het puur statisch wordt. Het model leert vervolgens het omgekeerde: uitgaande van ruis voorspelt en verwijdert het bij elke stap een beetje ruis, en herhaalt dit tientallen of honderden keren totdat er een scherp beeld ontstaat. Om dit controleerbaar te maken, begeleidt een tekstprompt elke ruisonderdrukkingsstap, zodat "een astronaut op een paard" de ruis naar dat beeld stuurt. Moderne systemen zoals Stable Diffusion voeren dit proces uit in een gecomprimeerde latente ruimte in plaats van op onbewerkte pixels, waardoor het veel sneller gaat. Vergeleken met GAN's trainen diffusiemodellen stabieler en produceren ze een grotere diversiteit. Daarom hebben ze GAN's ingehaald als de dominante benadering voor het genereren van hoogwaardige beelden rond 2022.
Technisch inzicht
De belangrijkste truc is dat het netwerk nooit in één keer een afbeelding hoeft te genereren; het leert alleen de toegevoegde ruis bij een bepaalde stap te voorspellen. Tijdens de training wordt een bekende hoeveelheid ruis aan een reëel beeld toegevoegd en wordt het model gevraagd die ruis in te schatten; het verschil is de trainingsfout. Tijdens het genereren trekt het model herhaaldelijk de voorspelde ruis af, waardoor geleidelijk de structuur zichtbaar wordt. Tekstconditionering wordt geïnjecteerd via kruisaandacht, en begeleiding zonder classificatie versterkt hoe sterk de prompt de uitvoer stuurt.
Strategische impact
Clearer decisions
Het helpt u duidelijke technische claims te scheiden van marketingtaal.
Cost and budget
U kunt betere implementatievragen stellen voordat u geld of tijd uitgeeft.
Team and workflow
Teams met gedeeld begrip nemen betere product-, beleids- en leerbeslissingen.
De toekomst van diffusiemodellen
Diffusie is de huidige stand van de techniek voor het genereren van beelden, en in toenemende mate ook voor video en audio, met tools als Sora die dit uitbreiden naar beweging. Het grote voordeel is snelheid: technieken als destillatie- en consistentiemodellen hebben tot doel honderden stappen voor het verwijderen van ruis terug te brengen tot een handvol of zelfs één, waardoor real-time generatie mogelijk wordt. Verwacht dat de verspreiding zich zal uitbreiden naar 3D-middelen, wetenschappelijk ontwerp zoals moleculen en eiwitten, en strak controleerbare bewerking, terwijl het goedkoop genoeg wordt om op telefoons te draaien.
Implementatie in de echte wereld
Originele illustraties en afbeeldingen maken op basis van tekstprompts in Stable Diffusion, DALL-E en Midjourney
In- en uitschilderen, delen van een foto naadloos invullen of uitbreiden
Video genereren uit tekst in tools zoals OpenAI's Sora
Het ontwerpen van nieuwe moleculen en eiwitstructuren voor onderzoek naar geneesmiddelenontwikkeling
Risico's en vangrails
Verschillende teams kunnen dezelfde term verschillend gebruiken, dus definieer de reikwijdte vroeg.
Benchmarks kunnen er sterk uitzien, terwijl de prestaties in de echte wereld ongelijkmatig zijn.
Het negeren van datakwaliteit en evaluatieplannen zorgt vaak voor fragiele resultaten.
Implementatie routekaart
Begin met een definitie in duidelijke taal van het gewenste resultaat.
Kies één successtatistiek en één faalconditie voordat u gaat testen.
Voer een kleine pilot uit met representatieve gegevens, niet met een gepolijste demoset.
Documenteer waar diffusiemodellen helpen en waar eenvoudigere methoden beter zijn.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
GLIDE-diffusiemodel
Frequently asked questions
What is Diffusion Models?
Diffusiemodellen genereren beelden door te leren een ruisproces om te keren, waarbij willekeurige statische beelden stap voor stap worden omgezet in gedetailleerde beelden. Ze vormen de drijvende kracht achter de toonaangevende tekst-naar-afbeelding-tools zoals Stable Diffusion, DALL-E en Midjourney.
Wat is het kernidee achter de manier waarop een diffusiemodel een beeld genereert?
Een diffusiemodel leert een ruisproces om te keren, beginnend bij pure ruis en stap voor stap ruis verwijderen totdat er een helder beeld verschijnt.
Wat leert het model tijdens de training eigenlijk bij elke stap te voorspellen?
Het model krijgt een beeld met ruis en leert de toegevoegde ruis in te schatten, zodat het later tijdens het genereren ruis kan aftrekken.
Hoe beïnvloedt een tekstprompt de gegenereerde afbeelding?
Tekstconditionering (via kruisaandacht en begeleiding) stimuleert elke stap van het verwijderen van ruis, zodat het opkomende beeld overeenkomt met de prompt.
Waarom voert Stable Diffusion het proces uit in een 'latente ruimte'?
Het werken in een gecomprimeerde latente ruimte in plaats van pixels met volledige resolutie vermindert de rekenkracht dramatisch, terwijl de kwaliteit behouden blijft.
Wat is een belangrijk voordeel van diffusiemodellen ten opzichte van GAN's?
Diffusiemodellen vermijden het onstabiele vijandige spel en de ineenstorting van de modus van GAN's, wat een betrouwbaardere training en een grotere outputvariatie oplevert.