ビジュアルAIガイド

SDXL とカスケード拡散

SDXL は、Stability AI の高解像度のテキストから画像へのモデルであり、強力なベース ジェネレーターとリファイナーを組み合わせ、複数のモデルをカスケード拡散チェーンして低解像度から高解像度までの画像を構築します。

2分の読書最終更新日

概要

Together they explain how modern open-source image generators hit photorealistic quality.

ディープダイブ

SDXL (Stable Diffusion XL) は、約 35 億パラメータの拡散モデルで、1024x1024 の画像をネイティブに生成します。これは、元の 512x512 の Stable Diffusion を大幅に上回ります。 2 つのテキスト エンコーダー (OpenCLIP ViT-bigG および CLIP ViT-L) を使用して、より迅速な理解を深め、モデルがターゲットの解像度とフレームを認識できるようにサイズとクロップ コンディショニングを追加します。 SDXL は 2 段階のパイプラインとして出荷されます。ベース モデルが潜在イメージを生成し、次にオプションのリファイナー モデルが最終的なノイズ除去ステップで詳細を追加します。カスケード拡散は、この背後にあるより広範なアイデアです。1 つのモデルがすべてを行うのではなく、低解像度の画像を作成する小さなモデルと、それをアップスケールする超解像度の拡散モデルを連結し、それぞれがその段階に合わせてトレーニングされます。 Google の Imagen は、カスケード アプローチを普及させました。

技術的な洞察

どちらもノイズ除去フレームワークで動作します。テキストに基づいてランダムなノイズから開始し、繰り返し予測して削除します。 SDXL は VAE を介して圧縮された潜在空間で動作するため、ノイズ除去は生のピクセルで作業するよりも安価です。リファイナーは、最後の低ノイズ ステップのみを処理する別個のエキスパート モデルです。真のカスケードでは、基本モデルが小さな画像を出力し、条件付き超解像度拡散モデルがそれをアップサンプリングし、それぞれが低解像度の出力で条件付けされ、多くの場合、堅牢性を維持するためにノイズ コンディショニング拡張が使用されます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

SDXL とカスケード拡散の将来

傾向としては、ステップ数が減り、より高速になり、アーキテクチャが統合される傾向にあります。 SDXL Turbo や潜在一貫性モデルなどの蒸留方法では、生成をすでに 1 ~ 4 ステップに削減しています。拡散トランス (Stable Diffusion 3 や FLUX など) は主に U-Net バックボーンを置き換えており、エンドツーエンドの高解像度生成により明示的なカスケードへの依存が減少しています。効率が向上し続けるにつれて、洗練化、より優れたテキスト レンダリング、リアルタイムのオンデバイス画像合成がより緊密に統合されることが期待されます。

現実世界の実装

別のアップスケーラーを使用せずに、テキスト プロンプトから 1024x1024 のマーケティング アートとコンセプト アートを直接生成

SDXL ベース プラス リファイナー パイプラインを使用して、製品モックアップの顔とテクスチャに鮮明なディテールを追加します

SDXL Turbo を実行してインタラクティブなデザイン ツールでほぼ瞬時に画像をプレビューする

カスタムの超解像度カスケードを構築して、低解像度のスケッチを高解像度のイラストに変換する

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SDXL and Cascaded Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

カスタム拡散マルチコンセプトチューニング

よくある質問

What is SDXL and Cascaded Diffusion?

SDXL は、Stability AI の高解像度のテキストから画像へのモデルであり、強力なベース ジェネレーターとリファイナーを組み合わせ、複数のモデルをカスケード拡散チェーンして低解像度から高解像度までの画像を構築します。彼らは一緒に、最新のオープンソース画像ジェネレーターがどのようにしてフォトリアリスティックな品質を実現するのかを説明します。

元の Stable Diffusion と比較して、SDXL はどのようなネイティブ解像度で画像を生成しますか?

SDXL はネイティブで 1024x1024 の画像を生成します。これは、元の Stable Diffusion の 512x512 よりも 4 倍大きい領域です。

SDXL のリファイナー モデルの役割は何ですか?

リファイナーは、ベース モデルが潜在イメージを作成した後、細部を​​鮮明にするためにパイプラインの最後に適用される別個のエキスパート モデルです。

SDXL はテキスト エンコーダをいくつ使用しますか?

SDXL は、OpenCLIP ViT-bigG と CLIP ViT-L という 2 つのテキスト エンコーダを組み合わせて使用​​し、より豊かなプロンプト理解を実現します。

カスケード拡散の中心的な考え方は何ですか?

カスケード拡散は、それぞれが以前の低解像度出力に条件付けされた 1 つまたは複数の超解像度拡散モデルを備えた小さなベース ジェネレーターをチェーンします。

SDXL がピクセル上で直接ノイズを除去するのではなく、潜在空間でノイズを除去するのはなぜですか?

VAE は画像をより小さな潜在空間に圧縮するため、拡散プロセスはフル解像度の生ピクセルで処理するよりもはるかに安価です。