视觉人工智能指南

制作视频文本转视频

Make-A-Video 是 Meta 的 2022 年系统,可将文本提示转换为短视频剪辑,而无需对标记的文本-视频对进行训练。

阅读时间:2分钟最后更新

概述

这很重要,因为它表明文本到图像模型中的视觉知识可以仅使用未标记的视频来“教导”移动。

深入探讨

Make-A-Video 是 Meta AI 于 2022 年 9 月宣布的,它可以根据“一只穿着超级英雄斗篷的狗在天空飞翔”这样的句子生成几秒钟的视频。它的关键技巧是将外观与运动解耦:文本到图像模型(基于 CLIP 风格的联合文本图像空间和扩散构建)从数十亿张带字幕的图像中学习事物的外观,而单独的时空层仅从未标记的视频中学习事物如何移动。这避免了高质量文本视频对的稀缺性。基本模型产生低分辨率、低帧速率的剪辑,然后专用网络插入额外的帧并提高空间分辨率。尽管剪辑短、模糊且容易出现闪烁和扭曲,但其结果在当时却是惊人的连贯性。

技术洞察

Make-A-Video 通过添加伪时间层将 2D 图像生成卷积和注意力扩展到 3D。预训练的空间权重被冻结或微调,而新的时间层从原始视频中学习运动,因此不需要文本视频标签。然后,帧插值网络会致密时间线,超分辨率扩散模块会提升空间细节,将粗略的 16 帧、低分辨率草稿转变为级联管道中更平滑、更清晰的剪辑。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

制作视频文本转视频的未来

Make-A-Video 的图像优先加上未标记的运动配方为整个文本到视频浪潮奠定了基础。它的后代强调更长、更高分辨率、时间稳定的剪辑以及可控的摄像机运动和音频。即使架构转向基于变压器的潜在扩散和统一模型(也接受图像或视频调节以进行编辑和延续),预计核心思想(以低廉的成本重用大量图像知识和学习运动)仍将持续存在。

现实世界的实施

将单个描述性句子动画化为社交媒体帖子的短循环剪辑

将“泰迪熊画肖像”之类的静态概念作为动态插图变为现实

在两个用户提供的静态图像之间进行插值以创建平滑的过渡视频

在拍摄之前生成想象场景的快速动作草稿以用于故事板

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Sora 和文本转视频

常见问题

什么是视频制作文本转视频?

Make-A-Video 是 Meta 的 2022 年系统,可将文本提示转换为短视频剪辑,而无需对标记的文本-视频对进行训练。这很重要,因为它表明文本到图像模型中的视觉知识可以仅使用未标记的视频来“教导”移动。

让 Make-A-Video 避免需要标记的文本-视频对的核心创新是什么?

Make-A-Video 解耦了这个问题:文本到图像模型从带字幕的图像中学习事物的外观,而单独的时间层从原始的、未标记的视频中学习运动。

Make-A-Video 如何为图像模型添加运动功能?

它通过新的时间层扩展了 2D 空间卷积和注意力,学习内容如何随时间变化。

帧插值和超分辨率阶段有什么作用?

在粗略的低分辨率、低帧速率草稿之后,插值添加帧,超分辨率模块提高分辨率。

Make-A-Video 输出的典型限制是什么?

剪辑只有几秒钟,分辨率相对较低,并且容易出现时间闪烁和失真。