GUIDE DE L'IA Visuelle

Stable Diffusion

Stable Diffusion est un modèle texte-image open source, publié par Stability AI en 2022, qui génère des images en supprimant progressivement le bruit à partir d'un point de départ aléatoire.

2 minutes de lectureDernière mise à jour

Aperçu

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

Plongée profonde

Les modèles de diffusion apprennent à inverser un processus de bruit. Pendant la formation, les images réelles reçoivent un bruit aléatoire ajouté étape par étape jusqu'à ce qu'elles deviennent statiques ; le modèle apprend à prédire et à soustraire ce bruit. Pour générer, il part du bruit pur et débruit à plusieurs reprises jusqu'à ce qu'une image cohérente apparaisse, guidée par votre invite de texte. La principale astuce d'efficacité de Stable Diffusion est la partie « latente » : au lieu de travailler sur des pixels en pleine résolution, il compresse les images dans un espace latent plus petit à l'aide d'un auto-encodeur variationnel, y exécute le débruitage lent, puis les décode en pixels. C'est pourquoi il peut fonctionner sur un GPU de jeu classique plutôt que sur un centre de données. Un encodeur de texte (CLIP dans les premières versions) convertit votre invite en guidage et un U-Net effectue le débruitage. Ses poids ouverts ont permis des réglages précis de ControlNet, LoRA et d'innombrables outils créatifs.

Aperçu technique

La diffusion stable est un modèle de diffusion latente. Un encodeur automatique réduit une image 512 x 512 en une grille latente compacte, réduisant ainsi considérablement les calculs. Un U-Net est formé pour prédire le bruit ajouté à chaque pas de temps, en fonction de l'intégration du texte via une attention croisée. Le guidage sans classificateur vous permet de déterminer dans quelle mesure l'image suit l'invite en mélangeant les prédictions conditionnées et inconditionnées. Lors de l'inférence, un échantillonneur (tel que DDIM ou Euler) effectue un nombre choisi d'étapes de débruitage ; plus d'étapes signifient généralement des résultats plus propres au détriment de la vitesse.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir de la diffusion stable

L'écosystème ouvert ne cesse de s'accélérer : les nouvelles architectures (y compris la diffusion basée sur un transformateur et les échantillonneurs distillés ou en quelques étapes plus rapides) réduisent la génération de dizaines d'étapes à une ou deux, permettant une création en temps quasi réel. Attendez-vous à un rendu de texte plus fort, à une meilleure adhésion rapide et à une édition d'image transparente, ainsi qu'à des extensions vidéo et 3D. Les pondérations ouvertes continueront à alimenter les ajustements spécialisés, mais elles intensifieront également les débats sur le consentement aux données de formation, les deepfakes et le filigrane, de sorte que les outils de détection et de provenance se développeront parallèlement aux modèles.

Mise en œuvre dans le monde réel

Artistes et amateurs générant des concepts artistiques et des illustrations localement sur leur propre GPU avec des réglages LoRA personnalisés

Utilisation de ControlNet pour contraindre une génération avec un squelette de pose, une carte de profondeur ou une esquisse de bord pour une composition précise

Inpainting et outpainting pour éditer des photos, supprimer des objets ou étendre une scène au-delà de ses frontières d'origine

Studios de jeux indépendants et concepteurs produisant des textures, des moodboards et des variantes d'actifs rapidement et à moindre coût

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Diffusion vidéo stable

Questions fréquemment posées

What is Stable Diffusion?

Stable Diffusion est un modèle texte-image open source, publié par Stability AI en 2022, qui génère des images en supprimant progressivement le bruit à partir d'un point de départ aléatoire. Ouvert et exécutable sur des GPU grand public, il a suscité une vaste communauté d'outils, de réglages et d'applications.

À un niveau élevé, comment un modèle de diffusion génère-t-il une image ?

Les modèles de diffusion apprennent à inverser un processus de bruit : à partir du bruit, ils débruitent de manière itérative jusqu'à ce qu'une image cohérente émerge.

Qu’est-ce qui rend Stable Diffusion suffisamment efficace pour fonctionner sur un GPU grand public ?

La diffusion stable est un modèle de diffusion latente : un auto-encodeur compresse les images afin que le débruitage important s'exécute dans un espace latent plus petit.

Comment votre invite de texte influence-t-elle l'image générée ?

Un encodeur de texte convertit l'invite en intégrations qui conditionnent le U-Net par une attention croisée, orientant ainsi le résultat.

Que vous permet de contrôler le guidage sans classificateur ?

Le guidage sans classificateur mélange les prédictions conditionnées et inconditionnées, vous permettant d'augmenter ou de diminuer l'adhésion rapide.

Pourquoi Stable Diffusion a-t-il déclenché un si vaste écosystème d'outils comme ControlNet et LoRA ?

Les pondérations ouvertes permettent à la communauté d'affiner et d'étendre le modèle, en produisant des modules complémentaires tels que ControlNet et des adaptateurs LoRA légers.