GUÍA visual de IA

Hacer un video Texto a video

Make-A-Video es el sistema 2022 de Meta que convierte un mensaje de texto en un videoclip corto sin siquiera entrenar en pares de texto y video etiquetados.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.

Buceo profundo

Make-A-Video, anunciado por Meta AI en septiembre de 2022, genera unos segundos de vídeo a partir de una frase como "un perro con una capa de superhéroe volando por el cielo". Su truco clave es desacoplar la apariencia del movimiento: un modelo de texto a imagen (construido sobre un espacio y difusión conjunto texto-imagen estilo CLIP) aprende cómo se ven las cosas a partir de miles de millones de imágenes subtituladas, mientras que capas espaciotemporales separadas aprenden cómo se mueven las cosas solo a partir de videos sin etiqueta. Esto evita la escasez de pares texto-vídeo de alta calidad. El modelo base produce clips de baja resolución y baja velocidad de fotogramas, luego las redes dedicadas interpolan fotogramas adicionales y mejoran la resolución espacial. El resultado fue sorprendentemente coherente para su época, aunque los clips eran cortos, borrosos y propensos a parpadear y deformarse.

Información técnica

Make-A-Video extiende la atención y las convoluciones de generación de imágenes 2D a 3D agregando capas pseudotemporales. Los pesos espaciales previamente entrenados se congelan o ajustan mientras que las nuevas capas temporales aprenden el movimiento del video sin procesar, por lo que no se necesitan etiquetas de texto-video. Luego, una red de interpolación de cuadros densifica la línea de tiempo y los módulos de difusión de superresolución aumentan los detalles espaciales, convirtiendo un borrador burdo de 16 cuadros y baja resolución en un clip más suave y nítido en una tubería en cascada.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de la conversión de texto a vídeo en Make-A-Video

La receta de imagen previa más movimiento sin etiquetar de Make-A-Video sembró toda la ola de conversión de texto a video. Sus descendientes enfatizan clips más largos, de mayor resolución y temporalmente estables con movimiento de cámara y audio controlables. Es de esperar que la idea central, reutilizar conocimiento masivo de imágenes y aprender movimiento de forma económica, persista incluso cuando las arquitecturas cambien hacia la difusión latente basada en transformadores y modelos unificados que también acepten el condicionamiento de imágenes o videos para edición y continuación.

Implementación en el mundo real

Animar una sola oración descriptiva en un clip corto en bucle para una publicación en las redes sociales.

Dar vida a un concepto estático como "un osito de peluche pintando un retrato" como una ilustración en movimiento

Interpolación entre dos imágenes fijas proporcionadas por el usuario para crear un vídeo de transición suave

Generar borradores en movimiento rápido de escenas imaginadas para el guión gráfico antes de cualquier filmación.

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Make-A-Video Text-to-Video?

Make-A-Video es el sistema 2022 de Meta que convierte un mensaje de texto en un videoclip corto sin siquiera entrenar en pares de texto y video etiquetados. Es importante porque demostró que se podía "enseñar" a moverse el conocimiento visual dentro de los modelos de texto a imagen utilizando únicamente videos sin etiquetar.

¿Cuál fue la innovación central que permitió a Make-A-Video evitar la necesidad de pares de texto y vídeo etiquetados?

Make-A-Video desacopla el problema: un modelo de texto a imagen aprende cómo se ven las cosas a partir de imágenes con subtítulos, mientras que capas temporales separadas aprenden el movimiento a partir de videos sin editar y sin etiquetar.

¿Cómo agrega Make-A-Video capacidad de movimiento a un modelo de imagen?

Amplía las convoluciones espaciales 2D y la atención con nuevas capas temporales que aprenden cómo el contenido cambia con el tiempo.

¿Qué hacen las etapas de interpolación de cuadros y superresolución?

Después de un borrador burdo de baja resolución y baja velocidad de fotogramas, la interpolación agrega fotogramas y los módulos de superresolución aumentan la resolución.

¿Cuál fue una limitación típica de la producción de Make-A-Video?

Los clips duraban solo unos segundos, tenían una resolución relativamente baja y eran propensos a parpadeos y distorsiones temporales.