視覺人工智慧指南

製作視頻文字轉視頻

Make-A-Video 是 Meta 的 2022 年系統,可將文字提示轉換為短影片剪輯,而無需對標記的文字-影片對進行訓練。

閱讀時間約2分鐘最後更新

概述

這很重要,因為它證明了文字轉圖像模型中的視覺知識可以只用無標籤的影片「教導」移動。

深入探討

Make-A-Video 是 Meta AI 於 2022 年 9 月宣布的,它可以根據「穿著超級英雄斗篷的狗在天空飛翔」這樣的句子生成幾秒鐘的影片。它的關鍵技巧是將外觀與運動解耦:文本到圖像模型(基於 CLIP 風格的聯合文本圖像空間和擴散構建)從數十億張帶字幕的圖像中學習事物的外觀,而單獨的時空層僅從未標記的視頻中學習事物如何移動。這避免了高品質文字影片對的稀缺性。基本型號產生低解析度、低幀速率的剪輯,然後專用網路插入額外的幀並提高空間解析度。儘管剪輯短、模糊且容易閃爍和扭曲,但其結果在當時卻是驚人的連貫性。

技術洞察

Make-A-Video 透過添加偽時間層將 2D 影像生成捲積和注意力擴展到 3D。預先訓練的空間權重被凍結或微調,而新的時間層從原始影片中學習運動,因此不需要文字視訊標籤。然後,幀插值網路會緻密時間線,超解析度擴散模組會提升空間細節,將粗略的 16 幀、低解析度草稿轉變為級聯管道中更平滑、更清晰的剪輯。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

製作影片文字轉影片的未來

Make-A-Video 的圖像優先加上未標記的運動配方為整個文本到視頻浪潮奠定了基礎。它的後代強調更長、更高解析度、時間穩定的剪輯以及可控的攝影機運動和音訊。即使架構轉向基於變壓器的潛在擴散和統一模型(也接受圖像或視訊調節以進行編輯和延續),預計核心思想(以低廉的成本重用大量圖像知識和學習運動)仍將持續存在。

現實世界的實施

將單一描述性句子動畫化為社群媒體貼文的短循環剪輯

將“泰迪熊畫肖像”之類的靜態概念作為動態插圖變為現實

在兩個用戶提供的靜態圖像之間進行插值以創建平滑的過渡視頻

在拍攝之前產生想像場景的快速動作草稿以用於故事板

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Make-A-Video Text-to-Video quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Sora 和文字轉視頻

常見問題

什麼是 Make-A-Video 文字轉影片?

Make-A-Video 是 Meta 的 2022 年系統,可將文字提示轉換為短影片剪輯,而無需對標記的文字-影片對進行訓練。這很重要,因為它表明文字到圖像模型中的視覺知識可以僅使用未標記的影片來「教導」移動。

讓 Make-A-Video 避免需要標記的文字-影片對的核心創新是什麼?

Make-A-Video 解耦了這個問題:文字到圖像模型從帶有字幕的圖像中學習事物的外觀,而單獨的時間層則從原始的、未標記的影片中學習運動。

Make-A-Video 如何為影像模型添加運動功能?

它透過新的時間層擴展了 2D 空間卷積和注意力,學習內容如何隨時間變化。

幀插值和超解析度階段有什麼作用?

在粗略的低解析度、低幀速率草稿之後,插值添加幀,超解析度模組提高解析度。

Make-A-Video 輸出的典型限制是什麼?

剪輯只有幾秒鐘,解析度相對較低,容易出現時間閃爍和失真。