基本ガイド

普及モデル

拡散モデルは、ノイズ プロセスを逆転することを学習して画像を生成し、ランダムな静的画像を段階的に詳細な画像に変換します。

2分の読書最終更新日

概要

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

ディープダイブ

拡散モデルは 2 つの方向でトレーニングされます。順方向プロセスでは、純粋な静的な画像になるまで、少量のランダム ノイズを追加することによって、きれいな画像が徐々に破損します。次に、モデルは逆の学習を行います。つまり、ノイズから開始して、各ステップで小さなノイズを予測して除去し、鮮明な画像が現れるまでこれを数十回または数百回繰り返します。これを制御可能にするために、テキスト プロンプトがノイズ除去の各ステップをガイドし、「馬に乗った宇宙飛行士」が静止画をその画像に向けて誘導します。 Stable Diffusion のような最新のシステムは、生のピクセルではなく圧縮された潜在空間でこのプロセスを実行するため、処理がはるかに高速になります。 GAN と比較して、拡散モデルはより安定して学習し、より大きな多様性を生み出すため、2022 年頃に高品質画像生成への主要なアプローチとして GAN を追い越しました。

技術的な洞察

重要なトリックは、ネットワークが一度に画像を生成する必要がないことです。特定のステップで追加されるノイズを予測することのみを学習します。トレーニング中に、既知の量のノイズが実際の画像に追加され、モデルはそのノイズを推定するように求められます。違いはトレーニングエラーです。生成時に、モデルは予測されたノイズを繰り返し減算し、徐々に構造を明らかにします。テキストの条件付けはクロスアテンションによって導入され、分類子を使用しないガイダンスにより、プロンプトが出力をどの程度強く制御するかが増幅されます。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

普及モデルの未来

拡散は、Sora のようなツールを使用して、画像、さらにはビデオとオーディオの生成における現在の最先端技術であり、それをモーションまで拡張します。大きな推進力は速度です。蒸留モデルや一貫性モデルなどの技術は、数百のノイズ除去ステップを数ステップ、あるいは 1 ステップにまで削減し、リアルタイム生成を可能にすることを目的としています。普及は、3D アセット、分子やタンパク質などの科学的デザイン、厳密に制御可能な編集にまで拡大し、同時に携帯電話で実行できるほど安価になることが期待されます。

現実世界の実装

Stable Diffusion、DALL-E、Midjourney のテキスト プロンプトからオリジナルのアートワークと画像を作成する

インペイントとアウトペイント、写真の一部をシームレスに塗りつぶしたり拡張したりする

OpenAI の Sora などのツールでテキストからビデオを生成する

創薬研究のための新規分子およびタンパク質構造の設計

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

拡散モデルが役立つ部分と、より単純な方法の方が優れている部分を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

GLIDE ディフュージョンモデル

よくある質問

What is Diffusion Models?

拡散モデルは、ノイズ プロセスを逆転することを学習して画像を生成し、ランダムな静的画像を段階的に詳細な画像に変換します。これらは、Stable Diffusion、DALL-E、Midjourney など、今日の主要なテキストから画像へのツールを強化します。

拡散モデルが画像を生成する仕組みの背後にある中心的な考え方は何ですか?

拡散モデルは、純粋なノイズから開始して、鮮明な画像が表示されるまで段階的にノイズを除去するという、ノイズ処理を逆にすることを学習します。

トレーニング中、モデルは各ステップで予測するために実際に何を学習するのでしょうか?

モデルにはノイズの多い画像が与えられ、追加されたノイズの推定方法を学習するため、後で生成中にノイズを差し引くことができます。

テキスト プロンプトは生成された画像にどのような影響を与えますか?

テキスト コンディショニング (クロス アテンションとガイダンスによる) により、ノイズ除去の各ステップが調整され、出現する画像がプロンプトと一致するようになります。

なぜ安定拡散は「潜在空間」でプロセスを実行するのでしょうか?

フル解像度のピクセルではなく圧縮された潜在空間で動作することで、品質を維持しながら計算量が大幅に削減されます。

GAN に対する拡散モデルの重要な利点の 1 つは何ですか?

拡散モデルは、GAN の不安定な敵対ゲームやモード崩壊を回避し、より信頼性の高いトレーニングとより多様な出力を実現します。