視覺人工智慧指南

視訊擴散模型

視訊擴散模型透過逐漸將隨機雜訊轉換為連貫影格來產生運動影像,將擴散思想從圖片擴展到時間。

閱讀時間約2分鐘最後更新

概述

They are the engine behind today's most realistic AI video.

深入探討

擴散模型學習逆轉噪聲過程:在訓練過程中,乾淨的資料逐漸添加噪聲,網路學習逐步預測和消除噪聲。視訊擴散將其應用於幀序列,並添加了關鍵的時間建模,使運動保持平滑,並且物件在時間上保持一致。為了使計算易於處理,大多數系統都是潛在擴散模型,在壓縮的潛在空間而不是原始像素上運行。架構範圍從具有空間和時間注意力的 3D U-Net 到將視訊視為時空令牌的擴散變換器 (DiT)。該系列為 Sora、Stable Video Diffusion、Runway Gen-3、Google Veo 和 Pika 提供支持,並支援文字到影片、圖像到影片和影片編輯。

技術洞察

關鍵技巧是添加時間層,例如時間注意力或 3D 卷積,因此幀是聯合去噪而不是獨立去噪,從而防止閃爍和不連貫的運動。產生使用無分類器的指導來強烈遵循文字提示,並且學習的 VAE 編碼器/解碼器在像素和潛在空間之間移動。對許多去雜訊步驟進行取樣很慢,因此使用蒸餾和更快的求解器來減少所需的步驟數。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

視訊傳播模型的未來

研究正在朝著更長、更高解析度、即時生成、同步音訊和更好的物理真實感的方向發展。透過數據和計算進行乾淨擴展的擴散變壓器正在成為主導設計,而少步蒸餾模型使生成速度大大加快。期望對攝影機、角色和編輯有更嚴格的控制,以及將擴散與其他生成方法結合的混合方法。隨著品質的提高,強大的浮水印和內容來源標準對於管理濫用至關重要。

現實世界的實施

為創作者提供 Stable Video Diffusion、Runway Gen-3 和 Pika 等文字轉影片工具

影像轉影片動畫,透過逼真的動作讓單張照片栩栩如生

專業後製工作流程中人工智慧輔助的影片編輯、修復和風格轉換

為機器人和自動駕駛汽車研究產生合成訓練片段和模擬

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Video Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

滑翔擴散模型

常見問題

What is Video Diffusion Models?

視訊擴散模型透過逐漸將隨機雜訊轉換為連貫影格來產生運動影像,將擴散思想從圖片擴展到時間。它們是當今最真實的人工智慧影片背後的引擎。

擴散模型背後的基本想法是什麼?

擴散模型經過訓練以消除逐漸添加到資料中的噪聲,然後透過對純噪聲進行去噪來產生。

與影像擴散模型相比,視訊擴散模型增加了什麼?

除了產生每一幀之外,視訊擴散還必須跨時間協調幀,需要時間層來保持運動連貫。

為什麼大多數視訊傳播模型都在「潛在」空間中運行?

原始視訊非常龐大;透過 VAE 將其編碼到更小的潛在空間中,使得去噪更有效率。

時間注意力或 3D 卷積在這些模型中的作用是什麼?

時間層連接幀之間的訊息,防止閃爍並產生連貫的運動,而不是獨立的、抖動的幀。

什麼技術可以幫助影片傳播模型強烈遵循文字提示?

無分類器指導將去噪過程更強烈地引導至調節提示,從而提高提示依從性。