GUIDE DE L'IA Visuelle

Modèles de diffusion latente

Les modèles de diffusion latente génèrent des images en exécutant le processus de diffusion dans un espace latent compressé au lieu de pixels bruts, réduisant ainsi les coûts de calcul.

2 minutes de lectureDernière mise à jour

Aperçu

Ils sont le moteur derrière Stable Diffusion et la plupart des générateurs d’images open source modernes.

Plongée profonde

Un modèle de diffusion standard apprend à inverser un processus de bruit : il part du bruit pur et se débruite progressivement pour donner une image. Faire cela directement sur les pixels coûte cher car une image 512x512 contient des centaines de milliers de valeurs. La diffusion latente, introduite par Rombach et ses collègues en 2022, utilise pour la première fois un auto-encodeur variationnel (VAE) pré-entraîné pour compresser une image dans une petite grille latente (souvent 64x64x4, environ 48x plus petite). La diffusion U-Net apprend alors à débruiter à l'intérieur de cet espace latent compact, guidée par le texte via une attention croisée. Enfin le décodeur VAE reconstruit les pixels en pleine résolution. Cette compression perceptuelle conserve les informations sémantiquement significatives tout en éliminant les détails imperceptibles, rendant ainsi possible une génération de haute qualité sur les GPU grand public.

Aperçu technique

L’astuce clé consiste à séparer la compression perceptuelle de la modélisation générative. Le VAE gère une seule fois les détails des pixels haute fréquence, et l'U-Net modélise uniquement la distribution latente de dimension inférieure. Le conditionnement du texte est injecté via des couches d'attention croisée, où les caractéristiques spatiales d'U-Net s'occupent des intégrations de jetons provenant d'un encodeur de texte tel que CLIP. Étant donné que les latents sont environ 48 fois plus petites que les pixels, chaque étape de débruitage est considérablement moins coûteuse en mémoire et en FLOP.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir des modèles de diffusion latente

La diffusion latente s'étend au-delà des images vers la vidéo (Stable Video Diffusion), les ressources 3D et les spectrogrammes audio, tous utilisant la même recette de compression puis de débruitage. La recherche s'oriente vers moins d'étapes d'échantillonnage via des modèles de distillation et de cohérence, de meilleurs VAE qui préservent la finesse du texte et des visages, et des formulations à flux rectifié comme celles de Stable Diffusion 3 qui redressent la trajectoire de génération pour des résultats plus rapides et plus précis.

Mise en œuvre dans le monde réel

Diffusion stable générant des illustrations et des conceptions à partir d'invites de texte sur un seul GPU grand public

Adobe et Canva alimentent les fonctionnalités de conversion texte-image et de remplissage génératif basées sur des piliers de diffusion latente

Studios de jeux produisant des cartes de textures, des sprites et des concepts artistiques d'environnement pour accélérer la pré-production

Les équipes de stockage d'images et de marketing créent des maquettes de produits et des visuels publicitaires adaptés à la marque sans séance photo.

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modèles de diffusion vidéo

Questions fréquemment posées

Qu’est-ce que les modèles de diffusion latente ?

Les modèles de diffusion latente génèrent des images en exécutant le processus de diffusion dans un espace latent compressé au lieu de pixels bruts, réduisant ainsi les coûts de calcul. Ils sont le moteur de Stable Diffusion et de la plupart des générateurs d’images open source modernes.

Quelle est la principale innovation des modèles de diffusion latente par rapport à la diffusion dans l’espace pixel ?

La diffusion latente compresse les images dans un espace latent plus petit à l'aide d'un VAE, de sorte que le débruitage coûteux se produit sur beaucoup moins de valeurs que les pixels complets.

Quel composant compresse une image dans l’espace latent et la reconstruit ensuite ?

Un VAE pré-entraîné code l'image dans une grille latente compacte et son décodeur reconstruit les pixels en pleine résolution à la fin.

Comment le texte est-il généralement injecté dans le U-Net débruitant en diffusion latente ?

Les intégrations de jetons provenant d'un encodeur de texte sont introduites dans des couches d'attention croisée, permettant aux entités spatiales de répondre à l'invite.

Pourquoi opérer dans un espace latent réduit-il le coût de calcul ?

Attendez - la bonne raison est que la grille latente est beaucoup plus petite (souvent ~ 48x) que l'image en pixels, donc chaque étape de débruitage nécessite beaucoup moins de FLOP et de mémoire.

Quel modèle open source largement utilisé a popularisé la diffusion latente ?

Stable Diffusion, sorti en 2022, a apporté une diffusion latente sur le matériel grand public et une adoption massive.