Modelos de difusión
Los modelos de difusión generan imágenes aprendiendo a revertir un proceso de ruido, convirtiendo la estática aleatoria en imágenes detalladas paso a paso.
Descripción general
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Buceo profundo
Un modelo de difusión se entrena en dos direcciones. En el proceso de avance, una imagen limpia se corrompe gradualmente añadiendo pequeñas cantidades de ruido aleatorio hasta que se vuelve pura estática. Luego, el modelo aprende lo contrario: a partir del ruido, predice y elimina un poco de ruido en cada paso, repitiendo docenas o cientos de veces hasta que emerge una imagen nítida. Para que esto sea controlable, un mensaje de texto guía cada paso de eliminación de ruido, de modo que "un astronauta montado a caballo" dirige la estática hacia esa imagen. Los sistemas modernos como Stable Diffusion ejecutan este proceso en un espacio latente comprimido en lugar de en píxeles sin formato, lo que lo hace mucho más rápido. En comparación con las GAN, los modelos de difusión se entrenan de manera más estable y producen una mayor diversidad, razón por la cual superaron a las GAN como el enfoque dominante para la generación de imágenes de alta calidad alrededor de 2022.
Información técnica
El truco clave es que la red nunca tiene que generar una imagen de una sola vez; sólo aprende a predecir el ruido agregado en un paso determinado. Durante el entrenamiento, se agrega una cantidad conocida de ruido a una imagen real y se le pide al modelo que estime ese ruido; la diferencia es el error de entrenamiento. En el momento de la generación, el modelo resta repetidamente el ruido previsto, revelando gradualmente la estructura. El condicionamiento del texto se inyecta mediante atención cruzada, y la guía sin clasificador amplifica la fuerza con la que el mensaje dirige la salida.
Impacto Estratégico
Decisiones más claras
Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.
Costo y presupuesto
Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.
Equipo y flujo de trabajo
Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.
El futuro de los modelos de difusión
La difusión es el estado actual del arte para la generación de imágenes y, cada vez más, de video y audio, con herramientas como Sora extendiéndola al movimiento. El gran impulso es la velocidad: técnicas como la destilación y los modelos de consistencia tienen como objetivo reducir cientos de pasos de eliminación de ruido a unos pocos o incluso a uno, lo que permite la generación en tiempo real. Espere que la difusión se expanda a activos 3D, diseños científicos como moléculas y proteínas y edición estrictamente controlable, al tiempo que se vuelve lo suficientemente barato como para ejecutarse en teléfonos.
Implementación en el mundo real
Creación de ilustraciones e imágenes originales a partir de mensajes de texto en Stable Diffusion, DALL-E y Midjourney
Pintar y pintar, rellenar o ampliar partes de una fotografía sin problemas
Generar video a partir de texto en herramientas como Sora de OpenAI
Diseño de nuevas moléculas y estructuras proteicas para la investigación del descubrimiento de fármacos.
Riesgos y barandillas
Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.
Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.
Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.
Hoja de ruta de implementación
Comience con una definición en lenguaje sencillo del resultado que necesita.
Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.
Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.
Documente dónde ayudan los modelos de difusión y dónde son mejores los métodos más simples.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Modelo de difusión GLIDE
Preguntas frecuentes
What is Diffusion Models?
Los modelos de difusión generan imágenes aprendiendo a revertir un proceso de ruido, convirtiendo la estática aleatoria en imágenes detalladas paso a paso. Impulsan las principales herramientas de conversión de texto a imagen de la actualidad, como Stable Diffusion, DALL-E y Midjourney.
¿Cuál es la idea central detrás de cómo un modelo de difusión genera una imagen?
Un modelo de difusión aprende a revertir un proceso de generación de ruido, comenzando desde el ruido puro y eliminando el ruido paso a paso hasta que aparece una imagen clara.
Durante el entrenamiento, ¿qué aprende realmente a predecir el modelo en cada paso?
El modelo recibe una imagen ruidosa y aprende a estimar el ruido que se agregó, para luego poder restar el ruido durante la generación.
¿Cómo influye un mensaje de texto en la imagen generada?
El acondicionamiento del texto (a través de atención cruzada y orientación) empuja cada paso de eliminación de ruido para que la imagen emergente coincida con el mensaje.
¿Por qué Stable Diffusion ejecuta el proceso en un "espacio latente"?
Operar en un espacio latente comprimido en lugar de píxeles de resolución completa reduce drásticamente la computación y al mismo tiempo preserva la calidad.
¿Cuál es una ventaja clave de los modelos de difusión sobre las GAN?
Los modelos de difusión evitan el juego adversario inestable y el colapso de modo de las GAN, lo que genera un entrenamiento más confiable y una mayor variedad de resultados.