ビジュアルAIガイド

DepthAnything 単眼の深さ

DepthAnything は、特別なハードウェアを使用せずに、1 枚の通常の写真から各ピクセルがどのくらい離れているかを推定する基礎モデルです。

2分の読書最終更新日

概要

It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.

ディープダイブ

DepthAnything (2024、TikTok/ByteDance および HKU の研究者を含む研究者によってリリース) は、単眼の深度推定、つまり 1 つの RGB 画像から深度マップを予測することに取り組んでいます。その画期的な点はスケールでした。利用可能な限定されたラベル付き深度データのみに依存するのではなく、チームは教師モデルを使用して約 6,200 万枚のラベルなし写真に自動ラベル付けするエンジンを構築し、この巨大なコーパスで学生をトレーニングしました。これにより、屋内、屋外、特殊なシーン全体で強力なゼロショットの一般化が実現します。オリジナルは相対的な深度 (正確なメートルではなく、どのピクセルが近いか遠いか) を出力します。 DepthAnything V2 (2024 年中頃) は、完璧なグラウンドトゥルースを使用して合成データで教師をトレーニングし、実際の画像に蒸留して、ぼやけたエッジや透明オブジェクトのエラーを修正することで、細部を鮮明にしました。

技術的な洞察

これは、DPT スタイルの高密度予測ヘッドに供給する DINOv2 ビジョン トランスフォーマー エンコーダーを使用します。重要なトリックは、半教師あり蒸留です。ラベル付きデータについて訓練された教師が、何百万枚ものラベルなし画像に擬似ラベルを付け、生徒は両方から学習します。 V2 は、ノイズの多い実際のラベルをピクセル完璧な深度の合成データと交換し、その後、実際の写真に戻して、鮮明な境界を維持しながら、実際の深度アノテーションの不足とノイズを回避します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

深さの未来何でも単眼の深さ

専用の LiDAR が高価またはかさばりすぎる場合、AR グラス、スマートフォンのカメラ、ロボット工学へのより緊密な統合が期待されます。正確なメーターを出力するメトリック バリアントに加え、時間的に安定した深度 (フレーム間のちらつきがない) を持つビデオ モデルが急速に進歩しています。これらのモデルがデバイス上でリアルタイムに実行できるように縮小されると、単一カメラの 3D 認識がデフォルトの機能となり、空間コンピューティング、自律ナビゲーション、および生成 3D シーンの再構築にフィードが提供されます。

現実世界の実装

深度マップを生成して、一眼スマートフォンのポートレート写真のリアルな背景のぼかし (ボケ) を実現します。

LiDAR やステレオ カメラを持たない低コストのドローンやロボットに 3D 障害物認識を提供します。

ControlNet の深度調整マップを作成して、イメージ ジェネレーターがシーン ジオメトリを保持できるようにします。

2D 写真やフィルムを VR や立体ディスプレイ用の 3D または視差効果に変換します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DepthAnything Monocular Depth quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

単眼の深さの推定

よくある質問

What is DepthAnything Monocular Depth?

DepthAnything は、特別なハードウェアを使用せずに、1 枚の通常の写真から各ピクセルがどのくらい離れているかを推定する基礎モデルです。これにより、堅牢な汎用深度センシングが安価になり、電話からロボットまであらゆるものに利用できるようになりました。

「単眼」深度推定とは何を意味しますか?

単眼とは、ステレオ ペアやアクティブ センサーを使用せず、1 台の (モノラル) カメラ画像から深度が推測されることを意味します。

強力な一般化を達成するための DepthAnything の主な戦略は何でしたか?

チームは、ラベルのない数千万枚の写真に擬似的にラベルを付けるデータ エンジンを構築し、トレーニングの規模を劇的に拡大しました。

DepthAnything はどのバックボーン エンコーダに基づいて構築されていますか?

DepthAnything は、DPT スタイルの高密度予測ヘッドと組み合わせた DINOv2 ViT エンコーダーを使用します。

オリジナルの DepthAnything は主にどのような深度を出力しますか?

基本モデルは、絶対的なメトリック距離ではなく、相対的な深さの順序を予測します。

DepthAnything V2 は細部とエッジをどのように改善しましたか?

V2 は、正確な深度の合成画像で教師をトレーニングし、その後、より鮮明な境界を得るために実際の写真に抽出しました。