ビジュアルAIガイド

DDPM および DDIM サンプラー

DDPM と DDIM は、拡散モデルの逆のプロセスを実行する 2 つの方法で、ランダム ノイズを段階的に画像に変換します。

2分の読書最終更新日

概要

DDPM is the original stochastic recipe; DDIM is a faster, deterministic shortcut that produces comparable images in far fewer steps.

ディープダイブ

拡散モデルは、ガウス ノイズを画像に徐々に追加し、そのノイズを予測する方法を学習することによってトレーニングされます。サンプリングはこれを逆転します。 DDPM (Denoising Diffusion Probabilistic Models、Ho et al. 2020) は、すべてのノイズ レベルを遡ってステップごとにランダム ノイズを新たに追加するため、通常は数百から千のステップが必要です。 DDIM (Denoising Diffusion Implicit Models、Song et al. 2021) は、まったく同じトレーニング済みネットワークを再利用しますが、非マルコフの決定論的な軌道に従います。注入されたランダム性を削除することで、DDIM は多くのタイムステップをスキップし、10 ~ 50 ステップで高品質の画像を得ることができます。 DDIM は決定論的であるため、同じ開始ノイズから常に同じ画像が得られ、スムーズな補間と再現性が可能になります。

技術的な洞察

どちらのサンプラーも、タイムステップ t で画像に追加されるノイズ イプシロンを予測するネットワークを使用します。 DDPM の更新では、その予測のスケーリングされたバージョンが減算され、事後から引き出された分散ノイズが追加されます。 DDIM は更新を書き換えて、最初にクリーンなイメージ x0 を推定し、それを確率項なしで次の (より小さい) タイムステップに再投影します。パラメータ eta は 2 つをブレンドします。eta=1 は DDPM を回復し、eta=0 は完全に決定的な DDIM を提供します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

DDPM と DDIM サンプラーの将来

サンプラーの研究は、1 ステップまたは数ステップの生成に向けて急ピッチで進められています。 DPM-Solver や DPM-Solver++ などの高次 ODE ソルバーは、すでに高品質サンプリングを 20 ステップ未満に削減していますが、蒸留手法 (漸進蒸留、整合性モデル、潜在整合性) はモデルを 1 ~ 4 ステップのジェネレーターに圧縮します。 DDPM/DDIM は概念的なベースラインにとどまると予想されますが、実稼働システムは民生用ハードウェアでのリアルタイムの画像およびビデオ合成のために蒸留された適応ソルバーに頼っています。

現実世界の実装

安定した拡散画像生成。DDIM は、Automatic1111 や ComfyUI などのツールのテキストから画像へのプロンプトの高速デフォルト サンプラーとして提供されます。

決定論的 DDIM でランダム シードを修正する再現可能なアート パイプラインにより、同じプロンプトとシードで常に同じイメージが再生成されます。

ノイズから出力までの DDIM の決定論的マッピングによって可能になる、モーフィング アニメーションのための 2 つの画像間のスムーズな潜在空間補間。

デザイナーが 20 ステップの DDIM プレビューを使用してコンセプトを検討し、より低速で忠実度の高いフルステップ レンダリングに取り組む前に、クリエイティブを迅速に反復します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DDPM and DDIM Samplers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

フレシェ開始距離

よくある質問

What is DDPM and DDIM Samplers?

DDPM と DDIM は、拡散モデルの逆のプロセスを実行する 2 つの方法で、ランダム ノイズを段階的に画像に変換します。 DDPM はオリジナルの確率的レシピです。 DDIM は、はるかに少ないステップで同等のイメージを生成する、より高速で決定的なショートカットです。

DDPM と比較した DDIM の主な実際的な利点は何ですか?

DDIM は決定論的な非マルコフ軌道に従い、多くのタイムステップをスキップして、数百ステップではなくおよそ 10 ~ 50 ステップで高品質の画像を生成します。

拡散モデルのニューラル ネットワークは、トレーニング中に実際に何を予測して学習するのでしょうか?

ネットワークは、各タイムステップで追加されるガウス ノイズ (イプシロン) を予測するようにトレーニングされており、DDPM と DDIM の両方がプロセスを逆転するために使用します。

DDIM が毎回同じ開始ノイズからまったく同じ画像を生成できるのはなぜですか?

DDIM は更新時に確率的ノイズ項を削除し、ノイズから画像へのパスが完全に決定的になるため、再現可能になります。

DDIM では、パラメータ eta のどの値が元の確率的 DDPM 動作を回復しますか?

eta パラメーターは 2 つのサンプラー間を補間します。eta=1 は完全な DDPM 確率性を与え、eta=0 は完全に決定論的な DDIM を与えます。

高品質のサンプルを得るために、元の DDPM では通常、およそ何ステップが必要でしたか?

DDPM は、ランダム性を追加してすべてのノイズ レベルを遡って処理するため、通常は数百から 1,000 のオーダーの逆ステップが必要です。