GUÍA visual de IA

Decodificación de tokens paralelos MaskGIT

MaskGIT genera imágenes prediciendo muchos tokens a la vez y completando primero los más confiables, reemplazando la generación lenta de izquierda a derecha con un puñado de pasos rápidos paralelos.

2 minutos de lecturaÚltima actualización

Buceo profundo

MaskGIT (Transformador de imágenes generativas enmascaradas), de Google en 2022, replantea cómo se decodifican los modelos de imágenes basados ​​en tokens. Los transformadores anteriores como VQGAN generaban tokens de forma autorregresiva, uno a la vez en orden ráster, lo cual es lento y antinatural para imágenes 2D. En cambio, MaskGIT entrena con un objetivo de modelado enmascarado como BERT: se ocultan subconjuntos aleatorios de tokens de imágenes y el modelo aprende a predecirlos todos simultáneamente utilizando atención bidireccional. En el momento de la generación, comienza a partir de una cuadrícula completamente enmascarada y se decodifica en un número fijo de iteraciones (a menudo de 8 a 12). En cada paso, predice cada token enmascarado, mantiene las predicciones de mayor confianza y vuelve a enmascarar el resto para la siguiente ronda. Esto produce imágenes de alta calidad en aproximadamente un orden de magnitud menos de pasos que la decodificación autorregresiva.

Información técnica

El componente crucial es el programa de enmascaramiento basado en la confianza. Un programa de coseno decide cuántos tokens revelar en cada iteración, comenzando lentamente y acelerando. Debido a que la atención es bidireccional, cada token ve la imagen parcial completa, por lo que realizar primero las predicciones más confiables permite que los pasos posteriores se condicionen a un contexto sólido, de manera muy parecida a resolver las partes fáciles de un rompecabezas antes que las ambiguas.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de la decodificación de tokens paralelos MaskGIT

La decodificación iterativa paralela de MaskGIT inspiró una ola de generadores no autorregresivos, incluido MUSE para conversión de texto a imagen y enfoques enmascarados para video. El patrón, que predice tokens en paralelo y se refina en unos pocos pasos, se ubica entre GAN de un solo uso y difusión de muchos pasos, lo que ofrece una compensación ajustable entre calidad y velocidad. Espere que la decodificación de tokens enmascarados siga apareciendo en generadores multimodales rápidos y sistemas de edición donde la pintura integrada y los rellenos condicionales son opciones naturales.

Implementación en el mundo real

Generar una imagen completa en aproximadamente 8 a 12 pasos paralelos en lugar de cientos de predicciones simbólicas autorregresivas

Pintar una región enmascarada de una foto volviendo a predecir solo los tokens ocultos con el contexto circundante

Síntesis de imágenes condicionales de clase en ImageNet con una calidad competitiva con modelos mucho más lentos

Sirve como columna vertebral de decodificación para sistemas de conversión de texto a imagen como MUSE de Google que necesitan una generación rápida.

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MaskGIT Parallel Token Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Decodificación paralela del esqueleto del pensamiento

Preguntas frecuentes

What is MaskGIT Parallel Token Decoding?

MaskGIT genera imágenes prediciendo muchos tokens a la vez y completando primero los más confiables, reemplazando la generación lenta de izquierda a derecha con un puñado de pasos rápidos paralelos.

¿Cómo decodifica MaskGIT los tokens de imágenes de manera diferente al transformador de VQGAN?

MaskGIT predice todos los tokens enmascarados simultáneamente con atención bidireccional, a diferencia de la lenta decodificación autorregresiva de izquierda a derecha de VQGAN.

¿Qué objetivo de formación toma MaskGIT de los modelos de lenguaje?

MaskGIT oculta subconjuntos aleatorios de tokens y aprende a predecirlos, un objetivo de modelado enmascarado similar a BERT.

Durante la generación, ¿qué tokens compromete MaskGIT en cada iteración?

Cada paso mantiene las predicciones más confiables y vuelve a enmascarar el resto, por lo que los pasos posteriores dependen de un contexto confiable.

¿Aproximadamente cuántas iteraciones suele necesitar MaskGIT para generar una imagen?

MaskGIT decodifica en un pequeño número fijo de pasos, a menudo de 8 a 12, muchos menos que los enfoques autorregresivos o de difusión.

¿Qué programa controla cuántos tokens MaskGIT revela en cada paso?

Un programa de coseno revela algunos tokens al principio y más después, equilibrando la calidad y la velocidad en las iteraciones.