視覺人工智慧指南

CogVideo 和 CogVideoX

CogVideo (2022) 是第一個大規模開放的文本到視訊模型,CogVideoX (2024) 是清華/智普人工智慧的更強大的開源繼承者。

閱讀時間約2分鐘最後更新

概述

They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.

深入探討

CogVideo於2022年發布,基於CogView2文本轉圖像轉換器構建,採用多幀率、自回歸的方法生成短片,成為第一個公開發布的大型文本轉視頻模型,並支持中英文提示。它的 2024 年繼任者 CogVideoX 是一次徹底的重新設計:它使用 3D 因果變分自動編碼器在空間和時間上壓縮視頻,然後使用具有擴散目標的專家轉換器,共同參與融合在一起的文本和視頻令牌。 CogVideoX 模型(尺寸如 2B 和 5B 參數)能夠以 720x480 等分辨率生成幾秒鐘的連貫、高動態視頻,並支援影像到視頻和視頻連續。至關重要的是,權重和程式碼是公開的,這推動了社群微調、工具和研究的浪潮。

技術洞察

CogVideoX 的 3D 因果 VAE 將原始視訊縮小為緊湊的潛在體積,從而減少了令牌數量,因此轉換器可以經濟地對長序列進行建模。專家轉換器應用自適應層規範並連接文字和視覺標記,以便兩種模式直接相互影響,從而改善文字視訊對齊。增加解析度和持續時間的漸進式訓練,加上仔細的資料字幕,可以產生更平滑、語義上更忠實的運動。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

CogVideo 和 CogVideoX 的未來

作為最強大的開放視訊模型之一,CogVideoX 錨定了一個快速成長的微調、控制適配器和較長持續時間擴展的生態系統。預計剪輯長度、解析度、運動真實感和可控性將持續提高,並且與影像到影片和編輯工作流程的整合將更加緊密。其開放權重意味著非營利組織、研究人員和小型工作室可以在沒有專有把關的情況下建立前沿級視訊生成,從而加速以創意和安全為重點的實驗。

現實世界的實施

使用完全開放權重根據中文或英文提示產生簡短的敘事剪輯

透過 CogVideoX 影像轉影片將單一上傳的靜態影像轉換為行動影片

根據獨立動畫的自訂風格或角色微調開放模型

研究人員根據可重複的開放基線對新的影片產生方法進行基準測試

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CogVideo and CogVideoX quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

InstructPix2Pix 指令編輯

常見問題

What is CogVideo and CogVideoX?

CogVideo (2022) 是第一個大規模開放的文本到視訊模型,CogVideoX (2024) 是清華/智普人工智慧的更強大的開源繼承者。它們很重要,因為它們將高品質的視訊生成交給了開放社區,而不僅僅是大型企業實驗室。

CogVideo 2022 年版本有哪些值得注意的地方?

CogVideo是第一個公開發布的大型文字轉影片模型,支援中英文提示。

CogVideoX 的 3D 因果 VAE 實現了什麼?

3D 因果 VAE 在空間和時間維度上壓縮視頻,減少標記數量,以便轉換器可以有效地對其進行建模。

CogVideoX 中的 Expert Transformer 如何處理文字和影片?

Expert Transformer 將文字和視覺標記與自適應標準化融合在一起,從而改善提示和生成影片之間的對齊。

CogVideo 和 CogVideoX 是哪個小組開發的?

CogVideo家族來自清華大學和智普AI的研究人員。

除了文字轉影片之外,CogVideoX 還支援哪些附加功能?

CogVideoX 可以將靜態圖像動畫化(圖像到影片)並擴展現有剪輯(延續),超越純文字提示。