ビジュアルAIガイド

拡散変圧器

拡散トランスフォーマー (DiT) は、画像およびビデオ ジェネレーターの中心となる畳み込み U-Net を Transformer バックボーンと交換します。

2分の読書最終更新日

概要

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

ディープダイブ

拡散モデルは、純粋なノイズから開始して反復的にノイズを除去して一貫した画像を生成することによって画像を生成します。長年にわたり、そのノイズ除去を行うネットワークは、畳み込みアーキテクチャである U-Net でした。 Peebles と Xie が 2022 年に導入した Diffusion Transformer は、U-Net を Transformer に置き換えます。画像はまず潜在空間に圧縮され、小さなパッチに分割され、言語モデルの単語と同じように、各パッチがトークンになります。次に、Transformer は、ノイズ除去の各ステップでセルフアテンションを使用してこれらのトークンを処理します。重要な発見は、クリーンなスケーリング則に従ってモデル サイズを増やし、パッチ サイズを減らすと、DiT のパフォーマンスが予想どおりに向上するということでした。この拡張性が、テキストからビデオへのシステムやハイエンドのテキストから画像へのシステムの大部分が Transformer バックボーンに移行した理由です。

技術的な洞察

核となる革新は、DiT がタイムステップやテキスト プロンプトなどの条件付けをどのように挿入するかです。単純な連結ではなく、適応層正規化 (adaLN) を使用します。この場合、ネットワークは調整信号から正規化層のスケールとシフト パラメーターを予測します。 adaLN-zero バリアントはこれらを初期化するため、各ブロックが恒等関数として開始され、トレーニングが安定します。パッチはトークンに平坦化され、セルフアテンションを備えた標準の Transformer ブロックによって処理され、再構築されてピクセルにデコードされます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

拡散変圧器の未来

拡散トランスフォーマーは、生成メディアのデフォルトのバックボーンになりつつあります。トークンベースの設計により、画像、ビデオ、さらにはマルチモーダル生成を 1 つのスケーラブルなアーキテクチャの下で自然に統合できます。研究は、多くのトークンの二次コストを抑えるために、より長いビデオ、より高い解像度、より効率的な注意を目指して進められています。言語モデルと視覚モデルの間の収束が期待されます。そこでは、同様の Transformer スケーリング レシピとインフラストラクチャが両方に機能し、ワールド モデルとインタラクティブ ビデオの進歩が加速します。

現実世界の実装

OpenAI の Sora は、時空パッチ上の Transformer バックボーンを使用して、テキスト プロンプトから 1 分間の高忠実度ビデオを生成します。

Stable Diffusion 3 は、マルチモーダル拡散トランス (MMDiT) を採用し、生成された画像と詳細なテキストの説明をより適切に調整します。

研究者は、DiT を数十億のパラメーターに拡張し、画質が予測どおりに向上することを観察し、コンピューティング予算の決定に役立てています。

スタジオでは、DiT ベースのモデルを使用して短いクリップを拡張し、余分なビデオ フレームをノイズ除去のための追加のパッチ トークンとして扱います。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

空間変換ネットワーク

よくある質問

What is Diffusion Transformers?

拡散トランスフォーマー (DiT) は、画像およびビデオ ジェネレーターの中心となる畳み込み U-Net を Transformer バックボーンと交換します。このアーキテクチャは、Stable Diffusion 3 や OpenAI の Sora などの主要なシステムを強化し、コンピューティングを追加すると驚くほどうまく拡張できます。

従来の拡散モデルと比較して、拡散トランスはどのコンポーネントを置き換えますか?

DiT は、ノイズ除去を実行する畳み込みネットワークである U-Net を Transformer バックボーンに置き換えます。

DiT はどのようにして画像を Transformer が処理できるものに変換するのでしょうか?

潜在イメージは小さなパッチに分割され、各パッチは言語モデルの単語に似たトークンになります。

DiT の元の論文では、スケーリングについて何がわかりましたか?

DiT の品質は、スケーリングの法則に従ってモデルのコンピューティングを増やし、より小さなパッチを使用することで、クリーンで予測可能な方法で向上します。

DiT は通常、タイムステップやテキスト プロンプトなどの条件付けをどのように挿入しますか?

DiT は適応層正規化を使用してスケールを予測し、調整信号から正規化層のパラメーターをシフトします。

「adaLN-zero」初期化は何を実現しますか?

adaLN-zero は変調を初期化するため、各ブロックは最初にアイデンティティとして機能し、トレーニングを安定化および改善します。