GUÍA visual de IA

Imagen 2 y difusión optimizada para recompensas

Imagen 2 es el modelo fotorrealista de texto a imagen basado en difusión de Google, refinado con ajuste de recompensa para que sus resultados coincidan mejor con lo que la gente realmente quiere.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.

Buceo profundo

Imagen 2 se basa en la receta original de Imagen: un gran modelo de lenguaje congelado codifica el mensaje y una cascada de modelos de difusión convierte el ruido aleatorio en una imagen detallada sin dejar de ser fiel a ese texto. La adición principal es el ajuste de recompensas, donde un modelo de recompensa aprendido califica imágenes generadas por cualidades como alineación rápida, estética y realismo, y el modelo de difusión se ajusta para producir resultados de mayor puntuación. Esto refleja el aprendizaje reforzado a partir de la retroalimentación humana utilizada en los modelos de lenguaje. Imagen 2 mejoró el fotorrealismo, una ortografía más confiable del texto en la imagen, compatibilidad con mensajes multilingües y un mejor manejo de temas complicados como manos y rostros. También agregó pintura interna y externa, y Google lo combinó con la herramienta de marca de agua SynthID para marcar de manera invisible imágenes generadas por IA. Impulsó funciones en los productos Google y la experiencia ImageFX.

Información técnica

La difusión aprende a revertir un proceso de generación de ruido, eliminando gradualmente el ruido de un campo aleatorio en una imagen guiada por incrustaciones de texto. El ajuste de recompensas se encuentra en la cima: un modelo de recompensa, entrenado en función de las preferencias humanas, proporciona una señal que empuja el modelo de difusión hacia resultados que las personas califican más alto, similar a RLHF para el texto. Combinado con una guía sin clasificadores, que equilibra la fidelidad con la diversidad, esto permite que Imagen 2 optimice directamente la calidad percibida y la alineación en lugar de solo hacer coincidir la distribución del entrenamiento.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de Imagen 2 y la difusión optimizada

La difusión ajustada a las recompensas se está convirtiendo en el camino predeterminado hacia una generación controlable y de alta fidelidad, y las señales de recompensa se ampliarán para cubrir la seguridad, la factualidad y la equidad junto con la estética. Espere controles de edición más estrictos, muestreo más rápido mediante destilación y procedencia estándar mediante marcas de agua como SynthID. A medida que los modelos de preferencias se vuelven más matizados y por usuario, los generadores de imágenes adaptarán cada vez más el estilo y el contenido al gusto individual sin dejar de ser rastreables como si estuvieran creados por IA.

Implementación en el mundo real

Creación de imágenes de productos y marketing con texto preciso en la imagen, como eslóganes o etiquetas breves.

Inpainting para eliminar o reemplazar sin problemas objetos dentro de una foto existente.

Pintura exterior para expandir una escena para diferentes diseños, pancartas o relaciones de aspecto.

Generar activos creativos multilingües donde los mensajes y el texto renderizado aparecen en varios idiomas, con marcas de agua con SynthID para determinar su procedencia.

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen 2 and Reward-Tuned Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Difusión de vídeo estable

Preguntas frecuentes

What is Imagen 2 and Reward-Tuned Diffusion?

Imagen 2 es el modelo fotorrealista de texto a imagen basado en difusión de Google, refinado con ajuste de recompensa para que sus resultados coincidan mejor con lo que la gente realmente quiere. Es importante porque combina una excelente calidad de imagen y una representación precisa del texto con técnicas de alineación tomadas de la forma en que se entrenan los chatbots.

¿Qué técnica generativa central utiliza Imagen 2?

Imagen 2 es un modelo de difusión: aprende a revertir un proceso de ruido, convirtiendo el ruido aleatorio en una imagen detallada guiada por texto.

¿Qué aporta el ajuste de recompensas a Imagen 2?

El ajuste de recompensas afina el modelo utilizando un modelo de recompensa entrenado en función de las preferencias humanas, empujándolo hacia imágenes mejor alineadas y con mayor calificación.

¿A qué técnica del entrenamiento con modelos de lenguaje se parece el ajuste de recompensas de Imagen 2?

El ajuste de recompensas es conceptualmente similar al RLHF: un modelo de recompensa entrenado en preferencias guía el ajuste hacia resultados que los humanos prefieren.

¿Cómo entiende Imagen 2 el mensaje de texto?

Imagen 2 sigue la receta de Imagen de utilizar un modelo de lenguaje congelado grande para codificar el mensaje en incrustaciones de texto enriquecido.

¿Para qué se utiliza SynthID con las imágenes de Imagen 2?

SynthID agrega una marca de agua invisible para que las imágenes generadas por IA puedan identificar su procedencia, incluso después de algunas ediciones.