DreamFusion とスコア蒸留サンプリング
DreamFusion は、2D 画像拡散モデルを批評家として使用し、3D データでトレーニングすることはなく、テキストから 3D オブジェクトを生成します。
概要
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
ディープダイブ
2022 年の Google からの DreamFusion は、「2D テキストから画像へのモデルは、3D シーンにあらゆる角度から正しく見えるように教えることができますか?」と質問しました。 NeRF (Neural Radiance Field) を最適化することで、ランダムなカメラ視点からのレンダリングが、ノイズを加えてフリーズ拡散モデル (Imagen) に表示されたときに、テキスト プロンプトに対して妥当な画像としてスコアが付けられます。重要なのは、3D トレーニング データを使用しないことです。画期的な点はスコア蒸留サンプリング (SDS) です。SDS は、拡散モデルの高価な U-Net を介して逆伝播する代わりに、モデルの予測ノイズをレンダリングされたピクセル上の勾配信号として直接使用します。これを何千もの視点にわたって繰り返すことで、ジオメトリとビュー依存の外観を備えた一貫した 3D アセットが 1 つの文から彫刻されます。
技術的な洞察
SDS は、拡散モデルを凍結されたスコアリング関数として扱います。 NeRF をレンダリングし、ノイズを追加し、拡散 U-Net にそのノイズを予測するように依頼し、レンダリングされたイメージにプッシュバックされる (予測されたノイズから追加されたノイズを引いたもの) として勾配を計算し、したがって NeRF の重みを計算します。 U-Net ヤコビアンをスキップすると扱いやすくなります。鮮明な結果を得るには、分類子を使用しない高度なガイダンス (約 100) が必要です。これにより、特徴的な過飽和で、場合によってはぼやけた「DreamFusion の外観」が発生します。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
DreamFusion とスコア蒸留サンプリングの未来
SDS は、解像度と速度のための Magic3D、よりシャープで多様な出力のための ProlificDreamer の変分スコア蒸留、そして「Janus」多面アーティファクトを攻撃するメソッドなど、その弱点を修正する豊富な一連の作業を生み出しました。この分野では、SDS をマルチビュー拡散プリアやガウス スプラッティングなどの高速 3D 表現と組み合わせるケースが増えています。テキストから 3D への変換はより速く、より幾何学的に忠実になり、手作業でモデル化されたアセットとの差が縮まることが期待されます。
現実世界の実装
テキストのみから「小さな帽子をかぶったリスのデジタル一眼レフ写真」の 3D モデルを生成する
手動の 3D スカルプトを使用せずにドラフト ゲームおよび AR アセットを作成する
ゼロから構築するのではなく、アーティストが改良したエクスポート可能なメッシュを生成する
SDS に対して新しいテキストから 3D への変換手法を評価するための研究ベースライン
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
スコアベースの生成モデル
よくある質問
What is DreamFusion and Score Distillation Sampling?
DreamFusion は、2D 画像拡散モデルを批評家として使用し、3D データでトレーニングすることはなく、テキストから 3D オブジェクトを生成します。その中心となる発明であるスコア蒸留サンプリングは、テキストから 3D への分野全体の基礎となるレシピになりました。
DreamFusion はどの 3D 表現を最適化しますか?
DreamFusion は、レンダリングされたビューが 2D 拡散モデルのテキスト プロンプトの判断を満たすように NeRF を最適化します。
DreamFusion にはどのくらいの 3D トレーニング データが必要ですか?
DreamFusion は、フリーズされた 2D テキストから画像への拡散モデルを唯一の監視として使用し、3D トレーニング データを必要としません。
スコア蒸留サンプリングにおける重要な計算ショートカットは何ですか?
SDS は、予測マイナス付加ノイズをレンダリングされたピクセルの直接勾配として使用し、コストのかかる U-Net Jacobian を回避します。
DreamFusion が非常に高い分類子なしのガイダンス (~100) を使用するのはなぜですか?
SDS グラジエントはノイズが多く弱いため、鮮明なオンプロンプト ジオメトリを実現するには、異常に高いガイダンスが必要ですが、過飽和が発生します。
オリジナルの DreamFusion がフリーズされた以前として使用した 2D モデルはどれですか?
DreamFusion は、凍結されたスコアリング関数として、Google の Imagen テキストから画像への拡散モデルに基づいて構築されました。