Stable Diffusion
Stable Diffusion は、2022 年に Stability AI によってリリースされたオープンソースのテキストから画像へのモデルであり、ランダムな開始点から徐々にノイズを除去することで画像を生成します。
概要
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
ディープダイブ
拡散モデルはノイズプロセスを逆転させることを学習します。トレーニング中、実際の画像にはランダムなノイズが段階的に追加され、静的になります。モデルはそのノイズを予測して差し引くことを学習します。生成するには、純粋なノイズから開始し、テキスト プロンプトに従って一貫した画像が表示されるまでノイズ除去を繰り返します。 Stable Diffusion の重要な効率化の秘訣は「潜在」部分です。フル解像度のピクセルを処理する代わりに、変分オートエンコーダーを使用して画像をより小さな潜在空間に圧縮し、そこで低速のノイズ除去を実行してから、デコードしてピクセルに戻します。データセンターではなく、一般的なゲーム用 GPU で実行できるのはこのためです。テキスト エンコーダ (初期バージョンでは CLIP) がプロンプトをガイダンスに変換し、U-Net がノイズ除去を行います。オープンウェイトにより、ControlNet、LoRA 微調整、および無数のクリエイティブ ツールが可能になりました。
技術的な洞察
安定拡散は潜在拡散モデルです。オートエンコーダーは 512x512 の画像をコンパクトな潜在グリッドに縮小し、計算を大幅に削減します。 U-Net は、クロスアテンションによるテキスト埋め込みを条件として、各タイムステップで追加されるノイズを予測するようにトレーニングされています。分類子を使用しないガイダンスでは、条件付き予測と無条件予測を混合することで、画像がプロンプトにどの程度従うかを調整できます。推論時に、サンプラー (DDIM やオイラーなど) は選択された数のノイズ除去ステップを実行します。一般に、ステップ数が多いほど、速度は犠牲になりますが、よりきれいな結果が得られます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
安定普及の未来
オープン エコシステムは加速し続けています。新しいアーキテクチャ (トランスベースの拡散や高速な数ステップまたは蒸留サンプラーなど) により、生成が数十のステップから 1 つまたは 2 つのステップに削減され、ほぼリアルタイムの作成が可能になります。より強力なテキスト レンダリング、より適切なプロンプト遵守、シームレスな画像編集、さらにビデオと 3D 拡張機能が期待できます。オープンウェイトは特殊な微調整を促進し続けますが、トレーニングデータの同意、ディープフェイク、透かしをめぐる議論も激化するため、検出および来歴ツールもモデルとともに成長するでしょう。
現実世界の実装
アーティストや愛好家がカスタム LoRA 微調整を使用して、独自の GPU でローカルにコンセプト アートやイラストを生成
ControlNet を使用してポーズ スケルトン、深度マップ、またはエッジ スケッチで生成を制約し、正確な構成を実現する
写真を編集したり、オブジェクトを削除したり、元の境界を越えてシーンを拡張したりするためのインペイントとアウトペイント
インディー ゲーム スタジオとデザイナーがテクスチャ、ムード ボード、アセットのバリエーションを迅速かつ安価に作成
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
安定した動画の普及
よくある質問
What is Stable Diffusion?
Stable Diffusion は、2022 年に Stability AI によってリリースされたオープンソースのテキストから画像へのモデルであり、ランダムな開始点から徐々にノイズを除去することで画像を生成します。オープンでコンシューマー向け GPU で実行できるため、ツール、微調整、アプリの大規模なコミュニティを引き起こしました。
大まかに言うと、拡散モデルはどのように画像を生成するのでしょうか?
拡散モデルは、ノイズ処理を逆にすることを学習します。つまり、ノイズから開始して、一貫した画像が現れるまで繰り返しノイズを除去します。
Stable Diffusion がコンシューマ GPU で実行できるほど効率的になるのはなぜですか?
安定拡散は潜在拡散モデルです。オートエンコーダーは画像を圧縮するので、より小さな潜在空間で強力なノイズ除去が実行されます。
テキスト プロンプトは生成された画像にどのような影響を与えますか?
テキスト エンコーダーはプロンプトを、クロスアテンションを通じて U-Net を調整する埋め込みに変換し、結果を操作します。
分類子を使用しないガイダンスにより、何が制御できるようになりますか?
分類子を使用しないガイダンスでは、条件付き予測と無条件予測を組み合わせて、即時順守を増減させることができます。
なぜ安定拡散は ControlNet や LoRA のようなツールのこれほど大規模なエコシステムを引き起こしたのでしょうか?
オープンウェイトを使用すると、コミュニティがモデルを微調整して拡張し、ControlNet や軽量の LoRA アダプターなどのアドオンを作成できるようになります。