Grundlagen-Leitfaden

Diffusionsmodelle

Diffusionsmodelle erzeugen Bilder, indem sie lernen, einen Rauschprozess umzukehren und zufällige Statik Schritt für Schritt in detaillierte Bilder umzuwandeln.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Tiefer Einblick

Ein Diffusionsmodell wird in zwei Richtungen trainiert. Im Vorwärtsprozess wird ein sauberes Bild nach und nach durch das Hinzufügen kleiner Mengen zufälligen Rauschens verfälscht, bis es rein statisch wird. Das Modell lernt dann das Gegenteil: Ausgehend vom Rauschen prognostiziert und entfernt es bei jedem Schritt ein wenig Rauschen und wiederholt dies Dutzende oder Hunderte Male, bis ein scharfes Bild entsteht. Um dies kontrollierbar zu machen, leitet eine Textaufforderung jeden Entrauschungsschritt an, sodass „ein Astronaut auf einem Pferd“ die statische Aufladung auf dieses Bild lenkt. Moderne Systeme wie Stable Diffusion führen diesen Prozess in einem komprimierten latenten Raum statt auf Rohpixeln aus, was ihn wesentlich schneller macht. Im Vergleich zu GANs trainieren Diffusionsmodelle stabiler und erzeugen eine größere Diversität, weshalb sie um 2022 GANs als dominierenden Ansatz zur Erzeugung hochwertiger Bilder überholt haben.

Technischer Einblick

Der entscheidende Trick besteht darin, dass das Netzwerk nie ein Bild auf einmal erzeugen muss; Es lernt nur, das bei einem bestimmten Schritt hinzugefügte Rauschen vorherzusagen. Während des Trainings wird einem realen Bild eine bekannte Menge an Rauschen hinzugefügt und das Modell wird aufgefordert, dieses Rauschen abzuschätzen. Der Unterschied ist der Trainingsfehler. Zum Zeitpunkt der Generierung subtrahiert das Modell wiederholt sein vorhergesagtes Rauschen und enthüllt so nach und nach die Struktur. Die Textkonditionierung wird über Queraufmerksamkeit injiziert, und die klassifikatorfreie Führung verstärkt, wie stark die Eingabeaufforderung die Ausgabe steuert.

Strategische Auswirkungen

Klarere Entscheidungen

Es hilft Ihnen, klare technische Aussagen von der Marketingsprache zu trennen.

Kosten und Budget

Sie können bessere Fragen zur Implementierung stellen, bevor Sie Geld oder Zeit investieren.

Team und Arbeitsablauf

Teams mit gemeinsamem Verständnis treffen bessere Produkt-, Richtlinien- und Lernentscheidungen.

Die Zukunft der Diffusionsmodelle

Diffusion ist der aktuelle Stand der Technik für die Bild- und zunehmend Video- und Audiogenerierung, wobei Tools wie Sora sie auf Bewegung ausweiten. Der große Vorteil liegt in der Geschwindigkeit: Techniken wie Destillation und Konsistenzmodelle zielen darauf ab, Hunderte von Entrauschungsschritten auf eine Handvoll oder sogar einen zu reduzieren und so eine Echtzeitgenerierung zu ermöglichen. Erwarten Sie, dass sich die Verbreitung auf 3D-Assets, wissenschaftliches Design wie Moleküle und Proteine ​​sowie streng kontrollierbare Bearbeitung ausweitet und gleichzeitig billig genug wird, um auf Mobiltelefonen ausgeführt zu werden.

Reale Umsetzung

Erstellen von Originalvorlagen und Bildern aus Textaufforderungen in Stable Diffusion, DALL-E und Midjourney

Inpainting und Outpainting, nahtloses Ausfüllen oder Erweitern von Teilen eines Fotos

Generieren von Videos aus Text in Tools wie OpenAIs Sora

Entwurf neuartiger Moleküle und Proteinstrukturen für die Arzneimittelforschung

Risiken und Leitplanken

Unterschiedliche Teams verwenden denselben Begriff möglicherweise unterschiedlich. Definieren Sie daher frühzeitig den Geltungsbereich.

Benchmarks können stark aussehen, während die tatsächliche Leistung uneinheitlich ist.

Das Ignorieren von Datenqualität und Evaluierungsplänen führt oft zu fragilen Ergebnissen.

Implementierungs-Roadmap

1

Beginnen Sie mit einer klaren Definition des gewünschten Ergebnisses.

2

Wählen Sie vor dem Testen eine Erfolgsmetrik und eine Fehlerbedingung aus.

3

Führen Sie ein kleines Pilotprojekt mit repräsentativen Daten durch, nicht mit einem ausgefeilten Demoset.

4

Dokumentieren Sie, wo Diffusionsmodelle hilfreich sind und wo einfachere Methoden besser sind.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

What is Diffusion Models?

Diffusionsmodelle erzeugen Bilder, indem sie lernen, einen Rauschprozess umzukehren und zufällige Statik Schritt für Schritt in detaillierte Bilder umzuwandeln. Sie unterstützen die heute führenden Text-zu-Bild-Tools wie Stable Diffusion, DALL-E und Midjourney.

Was ist die Kernidee dahinter, wie ein Diffusionsmodell ein Bild erzeugt?

Ein Diffusionsmodell lernt, einen Rauschprozess umzukehren, indem es vom reinen Rauschen ausgeht und es Schritt für Schritt entrauscht, bis ein klares Bild erscheint.

Was lernt das Modell während des Trainings tatsächlich bei jedem Schritt vorherzusagen?

Das Modell erhält ein verrauschtes Bild und lernt, das hinzugefügte Rauschen abzuschätzen, sodass es später bei der Generierung Rauschen subtrahieren kann.

Wie beeinflusst eine Textaufforderung das generierte Bild?

Die Textkonditionierung (über Queraufmerksamkeit und Anleitung) stößt jeden Entrauschungsschritt an, sodass das entstehende Bild mit der Aufforderung übereinstimmt.

Warum führt Stable Diffusion den Prozess in einem „latenten Raum“ aus?

Der Betrieb in einem komprimierten latenten Raum anstelle von Pixeln mit voller Auflösung reduziert den Rechenaufwand erheblich und bewahrt gleichzeitig die Qualität.

Was ist ein wesentlicher Vorteil von Diffusionsmodellen gegenüber GANs?

Diffusionsmodelle vermeiden das instabile kontradiktorische Spiel und den Moduszusammenbruch von GANs, was zu einem zuverlässigeren Training und einer größeren Ausgabevielfalt führt.