CogVideo と CogVideoX
CogVideo (2022) は、最初の大規模なオープンなテキストからビデオへのモデルであり、CogVideoX (2024) は、清華/Zhipu AI からのはるかに高機能なオープンソースの後継モデルです。
概要
They matter because they put high-quality video generation into the hands of the open community, not just big corporate labs.
ディープダイブ
2022 年にリリースされた CogVideo は、CogView2 テキストから画像へのトランスフォーマー上に構築され、マルチフレーム レートの自己回帰アプローチを使用して短いクリップを生成し、公にリリースされた最初の大規模なテキストからビデオへのモデルとなり、中国語と英語のプロンプトをサポートしました。 2024 年の後継となる CogVideoX は完全に再設計されています。3D 因果変分オートエンコーダーを使用して空間と時間の両方でビデオを圧縮し、その後、融合されたテキストとビデオ トークンを共同で処理する拡散目標を備えたエキスパート トランスフォーマーを使用します。 CogVideoX モデル (2B および 5B パラメータのようなサイズ) は、720x480 などの解像度で数秒間の一貫性のある高動きのビデオを生成し、画像からビデオへの変換およびビデオの継続をサポートします。重要なのは、重みとコードが公開されており、コミュニティによる微調整、ツール、研究の波が促進されていることです。
技術的な洞察
CogVideoX の 3D 因果 VAE は、生のビデオをコンパクトな潜在ボリュームに縮小し、トークン数を大幅に削減するため、トランスフォーマーは長いシーケンスを手頃な価格でモデル化できます。 Expert Transformer はアダプティブ レイヤー ノルムを適用し、テキストとビジュアル トークンを連結するため、2 つのモダリティが直接相互に連携し、テキストとビデオの位置合わせが向上します。解像度と継続時間を増加させ、さらに注意深くデータ キャプションを付けることで段階的にトレーニングを行うことで、よりスムーズで意味的に忠実なモーションが得られます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
CogVideo と CogVideoX の将来
CogVideoX は、最も強力なオープン ビデオ モデルの 1 つとして、微調整、制御アダプター、および長時間の拡張機能の急速に成長するエコシステムを支えています。クリップの長さ、解像度、モーションのリアリズム、制御性が引き続き向上し、さらに画像からビデオへの変換や編集ワークフローとのより緊密な統合が期待されます。そのオープンウェイトにより、非営利団体、研究者、小規模スタジオは独自のゲートキーピングなしでフロンティアクラスのビデオ生成を構築でき、創造性と安全性を重視した実験の両方を加速できます。
現実世界の実装
完全に開いたウェイトを使用して中国語または英語のプロンプトから短いナラティブ クリップを生成する
CogVideoX image-to-video を介して、アップロードされた 1 つの静止画像を動画に変換する
インディーズ アニメーション用のカスタム スタイルまたはキャラクターに基づいてオープン モデルを微調整する
研究者は、再現可能なオープンベースラインに対して新しいビデオ生成方法をベンチマークしています
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CogVideo and CogVideoX quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
InstructPix2Pix 命令編集
よくある質問
What is CogVideo and CogVideoX?
CogVideo (2022) は、最初の大規模なオープンなテキストからビデオへのモデルであり、CogVideoX (2024) は、清華/Zhipu AI からのはるかに高機能なオープンソースの後継モデルです。これらは、高品質のビデオ生成を大企業のラボだけでなくオープン コミュニティの手に委ねるために重要です。
CogVideo の 2022 年のリリースで注目すべき点は何ですか?
CogVideo は、公にリリースされた最初の大規模なテキストからビデオへのモデルであり、中国語と英語の両方のプロンプトをサポートしています。
CogVideoX の 3D 因果的 VAE は何を実現しますか?
3D 因果 VAE は、空間次元と時間次元の両方でビデオを圧縮し、トークン数を削減して、トランスフォーマーがビデオを効率的にモデル化できるようにします。
CogVideoX の Expert Transformer はテキストとビデオをどのように処理しますか?
Expert Transformer は、テキストとビジュアル トークンを適応正規化と融合させ、プロンプトと生成されたビデオの間の整合性を向上させます。
CogVideo と CogVideoX を開発したのはどのグループですか?
CogVideo ファミリは、清華大学と Zhipu AI に関連する研究者によって開発されました。
テキストからビデオへの変換以外に、CogVideoX はどのような追加機能をサポートしていますか?
CogVideoX は、プレーン テキスト プロンプトを超えて、静止画像をアニメーション化し (画像からビデオへ)、既存のクリップを拡張 (継続) できます。