Stable Diffusion
Stable Diffusion ist ein Open-Source-Text-zu-Bild-Modell, das 2022 von Stability AI veröffentlicht wurde und Bilder generiert, indem das Rauschen schrittweise von einem zufälligen Ausgangspunkt entfernt wird.
Übersicht
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
Tiefer Einblick
Diffusionsmodelle lernen, einen Rauschprozess umzukehren. Während des Trainings wird echten Bildern Schritt für Schritt zufälliges Rauschen hinzugefügt, bis sie statisch werden. Das Modell lernt, dieses Rauschen vorherzusagen und zu subtrahieren. Zur Generierung beginnt es mit reinem Rauschen und entrauscht wiederholt, bis ein zusammenhängendes Bild erscheint, geleitet von Ihrer Textaufforderung. Der wichtigste Effizienztrick von Stable Diffusion ist der „latente“ Teil: Anstatt an Pixeln mit voller Auflösung zu arbeiten, komprimiert es Bilder mithilfe eines Variations-Autoencoders in einen kleineren latenten Raum, führt dort die langsame Rauschunterdrückung durch und dekodiert sie dann wieder in Pixel zurück. Aus diesem Grund kann es auf einer typischen Gaming-GPU statt auf einem Rechenzentrum ausgeführt werden. Ein Textencoder (CLIP in früheren Versionen) wandelt Ihre Eingabeaufforderung in eine Anleitung um, und ein U-Net übernimmt die Rauschunterdrückung. Seine offenen Gewichte ermöglichten ControlNet, LoRA-Feinabstimmungen und unzählige kreative Tools.
Technischer Einblick
Stabile Diffusion ist ein latentes Diffusionsmodell. Ein Autoencoder verkleinert ein 512x512-Bild in ein kompaktes latentes Raster und reduziert so den Rechenaufwand erheblich. Ein U-Net ist darauf trainiert, das bei jedem Zeitschritt hinzugefügte Rauschen vorherzusagen, abhängig von der Texteinbettung über Kreuzaufmerksamkeit. Mit der klassifizierungsfreien Anleitung können Sie festlegen, wie stark das Bild der Aufforderung folgt, indem Sie bedingte und unbedingte Vorhersagen mischen. Bei der Inferenz führt ein Sampler (z. B. DDIM oder Euler) eine ausgewählte Anzahl von Entrauschungsschritten aus; Mehr Schritte bedeuten im Allgemeinen sauberere Ergebnisse auf Kosten der Geschwindigkeit.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Visuelle KI kann Inspektions-, Erkennungs- und Kennzeichnungsaufgaben im großen Maßstab automatisieren.
Bauen Sie Entscheidungen auf
Kreativteams können mit weniger manuellen Überarbeitungen schneller Prototypen von Konzepten erstellen.
Team und Arbeitsablauf
Vorgänge können Bild- und Videosignale nutzen, die bisher schwer zu verarbeiten waren.
Die Zukunft der stabilen Verbreitung
Das offene Ökosystem beschleunigt sich weiter: Neuere Architekturen (einschließlich transformatorbasierter Diffusion und schnellerer Wenigschritt- oder destillierter Sampler) reduzieren die Erzeugung von Dutzenden Schritten auf einen oder zwei und ermöglichen so eine Erstellung nahezu in Echtzeit. Erwarten Sie eine bessere Textwiedergabe, eine bessere Einhaltung der Eingabeaufforderungen und eine nahtlose Bildbearbeitung sowie Video- und 3D-Erweiterungen. Offene Gewichte werden weiterhin spezielle Feinabstimmungen vorantreiben, aber sie intensivieren auch die Debatten über die Einwilligung in Trainingsdaten, Deepfakes und Wasserzeichen, sodass neben den Modellen auch Erkennungs- und Herkunftstools wachsen werden.
Reale Umsetzung
Künstler und Bastler erstellen Konzeptzeichnungen und Illustrationen lokal auf ihrer eigenen GPU mit benutzerdefinierten LoRA-Feinabstimmungen
Verwenden Sie ControlNet, um eine Generation mit einem Posenskelett, einer Tiefenkarte oder einer Kantenskizze für eine präzise Komposition einzuschränken
Inpainting und Outpainting, um Fotos zu bearbeiten, Objekte zu entfernen oder eine Szene über ihre ursprünglichen Grenzen hinaus zu erweitern
Indie-Spielestudios und Designer produzieren schnell und kostengünstig Texturen, Moodboards und Asset-Variationen
Risiken und Leitplanken
Bildrechte und Einwilligungen können zu rechtlichen Risiken werden, wenn die Herkunft unklar ist.
Die Modellleistung kann je nach Beleuchtung, Demografie und Umgebung variieren.
Fehlalarme können unbemerkt bleiben, wenn die Konfidenzschwellen nicht überwacht werden.
Implementierungs-Roadmap
Definieren Sie Akzeptanzkriterien für Präzision, Rückruf und Fehlerkosten.
Testen Sie mit Daten, die den realen Produktionsbedingungen entsprechen.
Fügen Sie eine menschliche Überprüfung für Vorhersagen mit geringem Vertrauen oder großer Auswirkung hinzu.
Verfolgen Sie die Modelldrift und führen Sie nach Kamera- oder Datensatzänderungen eine erneute Validierung durch.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Stabile Videoverbreitung
Häufig gestellte Fragen
What is Stable Diffusion?
Stable Diffusion ist ein Open-Source-Text-zu-Bild-Modell, das 2022 von Stability AI veröffentlicht wurde und Bilder generiert, indem das Rauschen schrittweise von einem zufälligen Ausgangspunkt entfernt wird. Da es offen und auf Verbraucher-GPUs lauffähig ist, hat es eine riesige Community von Tools, Feinabstimmungen und Apps hervorgebracht.
Wie erzeugt ein Diffusionsmodell auf hoher Ebene ein Bild?
Diffusionsmodelle lernen, einen Rauschprozess umzukehren: Ausgehend vom Rauschen entrauschen sie iterativ, bis ein kohärentes Bild entsteht.
Was macht Stable Diffusion effizient genug, um auf einer Consumer-GPU ausgeführt zu werden?
Stable Diffusion ist ein latentes Diffusionsmodell: Ein Autoencoder komprimiert Bilder, sodass die starke Rauschunterdrückung in einem kleineren latenten Raum ausgeführt wird.
Wie beeinflusst Ihre Textaufforderung das generierte Bild?
Ein Textencoder wandelt die Eingabeaufforderung in Einbettungen um, die das U-Net durch Queraufmerksamkeit konditionieren und so das Ergebnis steuern.
Was können Sie mit der klassifikatorfreien Anleitung steuern?
Die klassifizierungsfreie Führung mischt konditionierte und unbedingte Vorhersagen und ermöglicht es Ihnen, die sofortige Einhaltung zu erhöhen oder zu verringern.
Warum hat Stable Diffusion ein so großes Ökosystem von Tools wie ControlNet und LoRA ins Leben gerufen?
Mit offenen Gewichten kann die Community das Modell verfeinern und erweitern und so Add-ons wie ControlNet und leichte LoRA-Adapter erstellen.