Modèles de diffusion
Les modèles de diffusion génèrent des images en apprenant à inverser un processus de bruit, transformant étape par étape des statiques aléatoires en images détaillées.
Aperçu
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Plongée profonde
Un modèle de diffusion est formé dans deux directions. Dans le processus de transmission, une image propre est progressivement corrompue par l'ajout de petites quantités de bruit aléatoire jusqu'à ce qu'elle devienne purement statique. Le modèle apprend ensuite l’inverse : à partir du bruit, il prédit et supprime un peu de bruit à chaque étape, en répétant des dizaines ou des centaines de fois jusqu’à ce qu’une image nette émerge. Pour rendre cela contrôlable, une invite textuelle guide chaque étape de débruitage, de sorte que « un astronaute montant un cheval » oriente la statique vers cette image. Les systèmes modernes comme Stable Diffusion exécutent ce processus dans un espace latent compressé plutôt que sur des pixels bruts, ce qui le rend beaucoup plus rapide. Par rapport aux GAN, les modèles de diffusion s'entraînent de manière plus stable et produisent une plus grande diversité, c'est pourquoi ils ont dépassé les GAN comme approche dominante pour la génération d'images de haute qualité vers 2022.
Aperçu technique
L’astuce clé est que le réseau n’a jamais besoin de générer une image en une seule fois ; il apprend seulement à prédire le bruit ajouté à une étape donnée. Pendant l'entraînement, une quantité connue de bruit est ajoutée à une image réelle et il est demandé au modèle d'estimer ce bruit ; la différence est l'erreur de formation. Au moment de la génération, le modèle soustrait à plusieurs reprises le bruit prédit, révélant progressivement la structure. Le conditionnement du texte est injecté via une attention croisée, et un guidage sans classificateur amplifie la force avec laquelle l'invite oriente la sortie.
Impact stratégique
Décisions plus claires
Il vous aide à séparer les affirmations techniques claires du langage marketing.
Coût et budget
Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.
Équipe et flux de travail
Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.
L'avenir des modèles de diffusion
La diffusion est l'état actuel de l'art en matière de génération d'images, et de plus en plus de vidéo et d'audio, avec des outils comme Sora qui l'étendent au mouvement. Le principal objectif est la rapidité : des techniques telles que les modèles de distillation et de cohérence visent à réduire des centaines d'étapes de débruitage à une poignée, voire une seule, permettant une génération en temps réel. Attendez-vous à ce que la diffusion s'étende aux actifs 3D, à la conception scientifique telle que les molécules et les protéines, et à l'édition étroitement contrôlable, tout en devenant suffisamment bon marché pour fonctionner sur les téléphones.
Mise en œuvre dans le monde réel
Création d'illustrations et d'images originales à partir d'invites de texte dans Stable Diffusion, DALL-E et Midjourney
Inpainting et outpainting, remplissage ou extension de parties d'une photo de manière transparente
Générer une vidéo à partir de texte dans des outils tels que Sora de OpenAI
Concevoir de nouvelles molécules et structures protéiques pour la recherche sur la découverte de médicaments
Risques et garde-fous
Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.
Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.
Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.
Feuille de route de mise en œuvre
Commencez par une définition en langage simple du résultat dont vous avez besoin.
Choisissez une mesure de réussite et une condition d’échec avant de tester.
Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.
Documentez où les modèles de diffusion sont utiles et où les méthodes plus simples sont préférables.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modèle de diffusion GLIDE
Questions fréquemment posées
What is Diffusion Models?
Les modèles de diffusion génèrent des images en apprenant à inverser un processus de bruit, transformant étape par étape des statiques aléatoires en images détaillées. Ils alimentent les principaux outils de conversion texte-image actuels tels que Stable Diffusion, DALL-E et Midjourney.
Quelle est l’idée centrale derrière la façon dont un modèle de diffusion génère une image ?
Un modèle de diffusion apprend à inverser un processus de bruit, en commençant par le bruit pur et en débruitant étape par étape jusqu'à ce qu'une image claire apparaisse.
Pendant la formation, qu’est-ce que le modèle apprend réellement à prédire à chaque étape ?
Le modèle reçoit une image bruitée et apprend à estimer le bruit qui a été ajouté, afin de pouvoir ensuite soustraire le bruit lors de la génération.
Comment une invite de texte influence-t-elle l'image générée ?
Le conditionnement du texte (via une attention croisée et des conseils) pousse chaque étape de débruitage afin que l'image émergente corresponde à l'invite.
Pourquoi Stable Diffusion exécute-t-elle le processus dans un « espace latent » ?
Opérer dans un espace latent compressé au lieu de pixels en pleine résolution réduit considérablement les calculs tout en préservant la qualité.
Quel est l’un des principaux avantages des modèles de diffusion par rapport aux GAN ?
Les modèles de diffusion évitent le jeu contradictoire instable et l’effondrement des modes des GAN, ce qui permet une formation plus fiable et une plus grande variété de résultats.