Faça um vídeo de texto para vídeo
Make-A-Video é o sistema 2022 de Meta que transforma um prompt de texto em um pequeno videoclipe sem nunca treinar em pares texto-vídeo rotulados.
Visão geral
It matters because it showed that the visual knowledge inside text-to-image models could be 'taught' to move using only unlabeled video.
Mergulho profundo
Make-A-Video, anunciado pela Meta AI em setembro de 2022, gera alguns segundos de vídeo a partir de uma frase como ‘um cachorro vestindo uma capa de super-herói voando pelo céu’. Seu truque principal é dissociar a aparência do movimento: um modelo de texto para imagem (construído em um espaço conjunto de texto-imagem e difusão no estilo CLIP) aprende como as coisas parecem a partir de bilhões de imagens legendadas, enquanto camadas espaço-temporais separadas aprendem como as coisas se movem apenas a partir de vídeos não rotulados. Isso evita a escassez de pares texto-vídeo de alta qualidade. O modelo básico produz clipes de baixa resolução e baixa taxa de quadros e, em seguida, redes dedicadas interpolam quadros extras e aumentam a resolução espacial. O resultado foi surpreendentemente coerente para a época, embora os clipes fossem curtos, borrados e propensos a tremer e distorcer.
Visão Técnica
Make-A-Video estende convoluções de geração de imagens 2D e atenção para 3D adicionando camadas pseudotemporais. Os pesos espaciais pré-treinados são congelados ou ajustados enquanto novas camadas temporais aprendem o movimento do vídeo bruto, portanto, nenhum rótulo de texto-vídeo é necessário. Uma rede de interpolação de quadros densifica a linha do tempo e os módulos de difusão de super-resolução aumentam os detalhes espaciais, transformando um rascunho grosseiro de 16 quadros e baixa resolução em um clipe mais suave e nítido em um pipeline em cascata.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro da conversão de texto em vídeo Make-A-Video
A receita de imagem anterior e movimento não rotulado do Make-A-Video semeou toda a onda de texto para vídeo. Seus descendentes enfatizam clipes mais longos, de maior resolução e temporalmente estáveis, com movimento de câmera e áudio controláveis. Espere que a ideia central, reutilizando o conhecimento massivo de imagens e aprendendo o movimento de forma barata, persista mesmo quando as arquiteturas mudam para difusão latente baseada em transformadores e modelos unificados que também aceitam condicionamento de imagem ou vídeo para edição e continuação.
Implementação no mundo real
Animando uma única frase descritiva em um clipe curto e repetido para uma postagem em mídia social
Dando vida a um conceito estático como 'um ursinho de pelúcia pintando um retrato' como uma ilustração em movimento
Interpolação entre duas imagens estáticas fornecidas pelo usuário para criar um vídeo de transição suave
Gerar rascunhos rápidos de cenas imaginadas para storyboard antes de qualquer filmagem
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Make-A-Video Text-to-Video quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Sora e conversão de texto em vídeo
Perguntas frequentes
What is Make-A-Video Text-to-Video?
Make-A-Video é o sistema 2022 de Meta que transforma um prompt de texto em um pequeno videoclipe sem nunca treinar em pares texto-vídeo rotulados. É importante porque mostrou que o conhecimento visual dentro dos modelos de texto para imagem poderia ser “ensinado” a se mover usando apenas vídeo não rotulado.
Qual foi a inovação central que permitiu ao Make-A-Video evitar a necessidade de pares texto-vídeo rotulados?
Make-A-Video dissocia o problema: um modelo de texto para imagem aprende a aparência das coisas a partir de imagens legendadas, enquanto camadas temporais separadas aprendem o movimento a partir de vídeo bruto e sem rótulo.
Como o Make-A-Video adiciona capacidade de movimento a um modelo de imagem?
Ele amplia as circunvoluções espaciais 2D e a atenção com novas camadas temporais que aprendem como o conteúdo muda ao longo do tempo.
O que fazem os estágios de interpolação de quadros e super-resolução?
Após um rascunho grosseiro de baixa resolução e baixa taxa de quadros, a interpolação adiciona quadros e os módulos de super-resolução aumentam a resolução.
Qual foi uma limitação típica da produção do Make-A-Video?
Os clipes duravam apenas alguns segundos, resolução relativamente baixa e sujeitos a oscilações e distorções temporais.