潜在拡散モデル
潜在拡散モデルは、生のピクセルではなく圧縮された潜在空間で拡散プロセスを実行することで画像を生成し、計算コストを削減します。
概要
They are the engine behind Stable Diffusion and most modern open-source image generators.
ディープダイブ
標準的な拡散モデルは、ノイズ プロセスを逆にすることを学習します。つまり、純粋なノイズから始まり、徐々にノイズが除去されて画像になります。 512x512 の画像には数十万の値があるため、これをピクセルに対して直接実行するとコストがかかります。 Rombach らによって 2022 年に導入された潜在拡散は、最初に事前トレーニングされた変分オートエンコーダー (VAE) を使用して、画像を小さな潜在グリッド (多くの場合 64x64x4、約 48 倍小さい) に圧縮します。その後、拡散 U-Net は、クロスアテンションを介してテキストに導かれ、そのコンパクトな潜在空間内でノイズを除去することを学習します。最後に、VAE デコーダがフル解像度のピクセルを再構築します。この知覚圧縮により、意味的に意味のある情報が保持されながら、知覚できない詳細が破棄されるため、コンシューマ GPU で高品質の生成が可能になります。
技術的な洞察
重要なトリックは、知覚圧縮を生成モデリングから分離することです。 VAE は高周波ピクセルの詳細を 1 回処理し、U-Net は低次元の潜在分布のみをモデル化します。テキスト コンディショニングは、クロス アテンション レイヤーを通じて注入されます。クロス アテンション レイヤーでは、U-Net の空間機能が CLIP などのテキスト エンコーダーからのトークン埋め込みに対応します。潜在はピクセルの約 48 分の 1 であるため、各ノイズ除去ステップはメモリと FLOP の両方で劇的に安価になります。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
潜在的な普及モデルの未来
潜在的な拡散は、画像を超えて、ビデオ (安定したビデオ拡散)、3D アセット、オーディオ スペクトログラムにまで拡大しており、すべて同じ圧縮してノイズを除去するレシピを使用しています。研究は、蒸留および一貫性モデルによるサンプリング ステップの削減、細かいテキストと面を保存するより優れた VAE、およびより高速で鮮明な結果を得るために生成軌道を直線化する Stable Diffusion 3 のような整流式の定式化に向けて推進しています。
現実世界の実装
単一のコンシューマ GPU 上のテキスト プロンプトからアートワークとコンセプト デザインを生成する Stable Diffusion
潜在的な拡散バックボーンに基づいて構築された、テキストから画像への変換機能とジェネレーティブフィル機能を強化する Adobe と Canva
テクスチャ マップ、スプライト、環境コンセプト アートを作成してプリプロダクションを加速するゲーム スタジオ
ストック画像チームとマーケティング チームが写真撮影を行わずにブランドに基づいた製品モックアップや広告ビジュアルを作成
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ビデオ普及モデル
よくある質問
What is Latent Diffusion Models?
潜在拡散モデルは、生のピクセルではなく圧縮された潜在空間で拡散プロセスを実行することで画像を生成し、計算コストを削減します。これらは、Stable Diffusion および最新のオープンソース画像ジェネレーターの背後にあるエンジンです。
ピクセル空間拡散と比較した潜在拡散モデルの主な革新は何ですか?
潜在拡散では、VAE を使用して画像をより小さな潜在空間に圧縮するため、高価なノイズ除去がフル ピクセルよりもはるかに少ない値で発生します。
画像を潜在空間に圧縮し、後でそれを再構成するコンポーネントはどれですか?
事前トレーニングされた VAE は画像をコンパクトな潜在グリッドにエンコードし、そのデコーダーは最後にフル解像度のピクセルを再構成します。
潜在拡散において、テキストは通常どのようにしてノイズ除去 U-Net に注入されるのでしょうか?
テキスト エンコーダーからのトークン埋め込みはクロスアテンション レイヤーに供給され、空間特徴がプロンプトに対応できるようにします。
潜在空間での演算により計算コストが削減されるのはなぜですか?
待ってください — 正しい理由は、潜在グリッドがピクセル イメージよりもはるかに小さい (多くの場合約 48 倍) ため、各ノイズ除去ステップで必要な FLOP とメモリがはるかに少ないためです。
潜在的な拡散を広めた、広く使用されているオープンソース モデルはどれですか?
2022 年にリリースされた Stable Diffusion は、コンシューマ ハードウェアへの潜在的な普及と大量採用をもたらしました。