マリーゴールドの拡散深さの推定
Marigold は、事前トレーニングされた画像生成拡散モデル (安定拡散) を再利用して、非常に詳細な深度マップを予測します。
概要
It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.
ディープダイブ
Marigold (ETH Zurich、CVPR 2024 Best Paper Honorable Mention) は、深度推定を条件付き生成問題として再構成しています。深度ネットワークを最初からトレーニングするのではなく、安定拡散を微調整して、入力画像に基づいて条件付けされた深度マップを「生成」します。その洞察は、フォトリアリスティックな画像を合成するようにトレーニングされたモデルが、潜在空間の奥深くにあるシーンのジオメトリ、照明、構造、つまり深度に役立つ事前分布をすでに学習しているということです。注目すべきことに、Marigold は合成データセット (Hypersim や Virtual KITTI など) のみに基づいて微調整されているにもかかわらず、ゼロショットの実際の写真によく一般化しています。非常に細かいディテールでアフィン不変の相対深度を生成しますが、反復的なノイズ除去により、DepthAnything のようなフィードフォワード モデルよりも遅くなります。
技術的な洞察
マリーゴールドは Stable Diffusion の潜在空間で動作します。画像と深度マップは両方とも同じ VAE によってエンコードされます。 U-Net は、クリーンなイメージ潜在に条件付けされた深度潜在のノイズを除去するように微調整されます。推論時に、標準の反復ノイズ除去ループを実行し、潜在深度をデコードします。サンプリングするため、安定性を確保するために複数の実行をアンサンブルし、精度を犠牲にしてコンピューティングを行うことができます。後の「LCM」および 1 段階蒸留バージョンでは、数十のステップが 1 回のパスにまで削減されました。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
マリーゴールドの将来の拡散深度推定
密な予測のために拡散事前分布を微調整するマリーゴールド レシピは、深さを超えて表面法線、固有の画像分解、マテリアル推定まで一般化しています。より高速に抽出された一貫性モデルのバリアントにより、フィードフォワード ネットワークとの速度差が縮まり、拡散ベースの認識が対話型ツールで実行可能になります。 1 つの事前トレーニング済み生成バックボーンが多くのジオメトリおよび知覚タスクに適応され、タスク固有のラベル付き大規模なデータセットの必要性が減少する、より広範な傾向が予想されます。
現実世界の実装
再照明や 3D モックアップのために、建築写真や製品写真から詳細な深度を抽出します。
制御可能な画像およびビデオ生成の条件付けとして使用される高詳細深度マップを生成します。
エッジの精度が重要となるマットおよびパララックス作業においてフィルムおよび VFX チームを支援します。
生成事前分布を高密度予測タスクに適応させる方法を示す研究ベースラインとして機能します。
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Marigold Diffusion Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
単眼の深さの推定
よくある質問
What is Marigold Diffusion Depth Estimation?
Marigold は、事前トレーニングされた画像生成拡散モデル (安定拡散) を再利用して、非常に詳細な深度マップを予測します。これは、驚くほど少ないトレーニング データで、ジェネレーターの豊富な視覚的知識を正確な認識ツールに変えることができることを示しています。
Marigold はどのような事前トレーニング済みモデルに基づいて構築されていますか?
Marigold は、Stable Diffusion 潜在拡散モデルを微調整して、深度マップを作成します。
マリーゴールドは深度推定タスクをどのように組み立てているのでしょうか?
深度は入力画像に基づいて「生成」されるものとして扱われ、拡散機構が再利用されます。
マリーゴールドの訓練データの何が意外でしたか?
Marigold は、Hypersim や Virtual KITTI などの合成データに基づいて微調整されていますが、ゼロショットから実際の写真までを一般化しています。
マリーゴールドは通常、フィードフォワード深度モデルよりも遅いのはなぜですか?
拡散モデルは複数のステップにわたってノイズを除去するため、単一の前方パスよりも推論が遅くなります。
マリーゴールドはどの空間で拡散プロセスを実行しますか?
画像と深度は両方とも、U-Net がノイズを除去する VAE 潜在空間にエンコードされます。