Basisprincipes GIDS

Verspreidingsmodellen

Diffusiemodellen genereren beelden door te leren een ruisproces om te keren, waarbij willekeurige statische beelden stap voor stap worden omgezet in gedetailleerde beelden.

2 min readLaatst bijgewerkt

Overzicht

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Diepe duik

Een diffusiemodel wordt in twee richtingen getraind. In het voorwaartse proces wordt een schoon beeld geleidelijk beschadigd door kleine hoeveelheden willekeurige ruis toe te voegen totdat het puur statisch wordt. Het model leert vervolgens het omgekeerde: uitgaande van ruis voorspelt en verwijdert het bij elke stap een beetje ruis, en herhaalt dit tientallen of honderden keren totdat er een scherp beeld ontstaat. Om dit controleerbaar te maken, begeleidt een tekstprompt elke ruisonderdrukkingsstap, zodat "een astronaut op een paard" de ruis naar dat beeld stuurt. Moderne systemen zoals Stable Diffusion voeren dit proces uit in een gecomprimeerde latente ruimte in plaats van op onbewerkte pixels, waardoor het veel sneller gaat. Vergeleken met GAN's trainen diffusiemodellen stabieler en produceren ze een grotere diversiteit. Daarom hebben ze GAN's ingehaald als de dominante benadering voor het genereren van hoogwaardige beelden rond 2022.

Technisch inzicht

De belangrijkste truc is dat het netwerk nooit in één keer een afbeelding hoeft te genereren; het leert alleen de toegevoegde ruis bij een bepaalde stap te voorspellen. Tijdens de training wordt een bekende hoeveelheid ruis aan een reëel beeld toegevoegd en wordt het model gevraagd die ruis in te schatten; het verschil is de trainingsfout. Tijdens het genereren trekt het model herhaaldelijk de voorspelde ruis af, waardoor geleidelijk de structuur zichtbaar wordt. Tekstconditionering wordt geïnjecteerd via kruisaandacht, en begeleiding zonder classificatie versterkt hoe sterk de prompt de uitvoer stuurt.

Strategische impact

Clearer decisions

Het helpt u duidelijke technische claims te scheiden van marketingtaal.

Cost and budget

U kunt betere implementatievragen stellen voordat u geld of tijd uitgeeft.

Team and workflow

Teams met gedeeld begrip nemen betere product-, beleids- en leerbeslissingen.

De toekomst van diffusiemodellen

Diffusie is de huidige stand van de techniek voor het genereren van beelden, en in toenemende mate ook voor video en audio, met tools als Sora die dit uitbreiden naar beweging. Het grote voordeel is snelheid: technieken als destillatie- en consistentiemodellen hebben tot doel honderden stappen voor het verwijderen van ruis terug te brengen tot een handvol of zelfs één, waardoor real-time generatie mogelijk wordt. Verwacht dat de verspreiding zich zal uitbreiden naar 3D-middelen, wetenschappelijk ontwerp zoals moleculen en eiwitten, en strak controleerbare bewerking, terwijl het goedkoop genoeg wordt om op telefoons te draaien.

Implementatie in de echte wereld

Originele illustraties en afbeeldingen maken op basis van tekstprompts in Stable Diffusion, DALL-E en Midjourney

In- en uitschilderen, delen van een foto naadloos invullen of uitbreiden

Video genereren uit tekst in tools zoals OpenAI's Sora

Het ontwerpen van nieuwe moleculen en eiwitstructuren voor onderzoek naar geneesmiddelenontwikkeling

Risico's en vangrails

Verschillende teams kunnen dezelfde term verschillend gebruiken, dus definieer de reikwijdte vroeg.

Benchmarks kunnen er sterk uitzien, terwijl de prestaties in de echte wereld ongelijkmatig zijn.

Het negeren van datakwaliteit en evaluatieplannen zorgt vaak voor fragiele resultaten.

Implementatie routekaart

1

Begin met een definitie in duidelijke taal van het gewenste resultaat.

2

Kies één successtatistiek en één faalconditie voordat u gaat testen.

3

Voer een kleine pilot uit met representatieve gegevens, niet met een gepolijste demoset.

4

Documenteer waar diffusiemodellen helpen en waar eenvoudigere methoden beter zijn.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

GLIDE-diffusiemodel

Frequently asked questions

What is Diffusion Models?

Diffusiemodellen genereren beelden door te leren een ruisproces om te keren, waarbij willekeurige statische beelden stap voor stap worden omgezet in gedetailleerde beelden. Ze vormen de drijvende kracht achter de toonaangevende tekst-naar-afbeelding-tools zoals Stable Diffusion, DALL-E en Midjourney.

Wat is het kernidee achter de manier waarop een diffusiemodel een beeld genereert?

Een diffusiemodel leert een ruisproces om te keren, beginnend bij pure ruis en stap voor stap ruis verwijderen totdat er een helder beeld verschijnt.

Wat leert het model tijdens de training eigenlijk bij elke stap te voorspellen?

Het model krijgt een beeld met ruis en leert de toegevoegde ruis in te schatten, zodat het later tijdens het genereren ruis kan aftrekken.

Hoe beïnvloedt een tekstprompt de gegenereerde afbeelding?

Tekstconditionering (via kruisaandacht en begeleiding) stimuleert elke stap van het verwijderen van ruis, zodat het opkomende beeld overeenkomt met de prompt.

Waarom voert Stable Diffusion het proces uit in een 'latente ruimte'?

Het werken in een gecomprimeerde latente ruimte in plaats van pixels met volledige resolutie vermindert de rekenkracht dramatisch, terwijl de kwaliteit behouden blijft.

Wat is een belangrijk voordeel van diffusiemodellen ten opzichte van GAN's?

Diffusiemodellen vermijden het onstabiele vijandige spel en de ineenstorting van de modus van GAN's, wat een betrouwbaardere training en een grotere outputvariatie oplevert.