GUÍA visual de IA

Imágenes generativas enmascaradas de Muse

Muse es un modelo de conversión de texto a imagen de Google que genera imágenes completando tokens de imágenes enmascaradas de una sola vez, lo que lo hace mucho más rápido que la difusión paso a paso.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

Buceo profundo

Muse trabaja en el espacio simbólico discreto de una imagen. Un VQGAN previamente entrenado convierte una imagen en una cuadrícula de tokens enteros, como un vocabulario de bloques de construcción visuales. Durante el entrenamiento, una gran fracción de estos tokens se enmascara y un Transformer aprende a predecirlos, condicionado a incrustaciones de texto de un modelo de lenguaje grande congelado (T5-XXL). En el momento de la generación, Muse comienza desde una cuadrícula completamente enmascarada y decodifica en rondas paralelas, prediciendo muchos tokens por paso y volviendo a enmascarar los menos seguros. Un diseño de dos etapas produce primero una cuadrícula de tokens de baja resolución, luego un modelo de superresolución llena una cuadrícula de mayor resolución. Debido a que docenas de tokens se resuelven simultáneamente, los modelos de parámetros 900M y 3B producen una imagen de 256 o 512 píxeles en sólo un puñado de pases hacia adelante.

Información técnica

El truco principal es la decodificación paralela con reenmascaramiento basado en la confianza, a menudo llamado muestreo estilo MaskGIT. En lugar de predecir un token a la vez (autoregresivo) o eliminar el ruido cientos de veces (difusión), Muse predice todos los tokens enmascarados, conserva los más seguros y vuelve a enmascarar el resto para la siguiente ronda. El uso de un codificador de texto congelado T5-XXL brinda una sólida comprensión del lenguaje de forma gratuita, y operar con tokens discretos permite que el modelo razone sobre imágenes más como palabras.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de las imágenes generativas enmascaradas de Muse

La decodificación paralela enmascarada apunta a generadores que son a la vez de alta calidad y realmente rápidos, lo cual es esencial para la edición interactiva y el uso en el dispositivo. Espere que la idea de predicción de tokens se fusione con los métodos de difusión y de vídeo autorregresivos, y que impulse la pintura instantánea, la pintura exterior y la edición sin máscaras. A medida que mejoran los tokenizadores discretos, las imágenes enmascaradas pueden extenderse claramente al video y al 3D, donde la decodificación paralela podría reducir drásticamente el costo de generar muchos fotogramas o vistas.

Implementación en el mundo real

Arte conceptual rápido y paneles de estado de ánimo en los que un artista necesita muchas variaciones de imágenes en segundos en lugar de minutos.

Pintura de disparo cero, como eliminar un objeto y hacer que el modelo llene la región enmascarada de manera consistente con el entorno.

Outpainting para extender una foto más allá de sus bordes originales para pancartas o diferentes relaciones de aspecto.

Edición sin máscara, como cambiar el color de un perro o el cielo al atardecer editando el mensaje de texto y redecodificando los tokens afectados.

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Codificadores automáticos enmascarados

Preguntas frecuentes

What is Muse Masked Generative Imaging?

Muse es un modelo de conversión de texto a imagen de Google que genera imágenes completando tokens de imágenes enmascaradas de una sola vez, lo que lo hace mucho más rápido que la difusión paso a paso. Es importante porque demostró que se pueden obtener imágenes bien alineadas y de alta calidad sin la lenta eliminación iterativa de ruido en la que confían la mayoría de los generadores.

¿Qué predice Muse durante la generación en lugar de eliminar el ruido de los píxeles?

Muse opera en un espacio de token discreto, prediciendo tokens de imágenes enmascaradas producidas por un tokenizador VQGAN en lugar de trabajar directamente en píxeles.

¿Por qué Muse es generalmente más rápido que los modelos de difusión estándar?

Muse completa muchos tokens enmascarados simultáneamente y solo necesita un puñado de rondas de decodificación, a diferencia de los muchos pasos secuenciales de eliminación de ruido de la difusión.

¿De dónde obtiene Muse su comprensión del mensaje de texto?

Muse condiciona la generación de texto incrustado a partir de un modelo de lenguaje T5-XXL preentrenado congelado, lo que le otorga una sólida comprensión del lenguaje.

¿Cuál es el papel del reenmascaramiento basado en la confianza en Muse?

Después de cada predicción paralela, Muse retiene los tokens más seguros y vuelve a enmascarar los menos seguros para perfeccionarlos en rondas sucesivas.

¿Cómo maneja Muse la producción de imágenes de mayor resolución?

Muse primero genera una cuadrícula de tokens de baja resolución, luego un segundo modelo de superresolución produce una cuadrícula de tokens de mayor resolución.