ビジュアルAIガイド

単眼の深さの推定

単眼の深度推定は、すべてのピクセルが 1 枚の通常の写真からどれだけ離れているかを予測します。ステレオ カメラ、LIDAR、深度センサーは必要ありません。

2分の読書最終更新日

概要

It lets one camera perceive 3D structure from a flat 2D image.

ディープダイブ

人間は、遠近感、相対的なサイズ、テクスチャのグラデーション、シェーディング、オクルージョンなどの手がかりを使用して、片目からの奥行きを判断できます。単眼深度推定は、単一の RGB 画像を入力し、各ピクセルの深度値を出力するという同じトリックをニューラル ネットワークに教えます。 2D 画像は本質的に絶対スケールが曖昧であるため、この作業は困難です。多くの 3D シーンが同じ画像に投影される可能性があります。ネットワークはこれを解決するために大規模なデータセットから統計的事前分布を学習します。トレーニングには、LIDAR または RGB-D センサーからのグラウンド トゥルース深度を使用する教師ありと、予測深度が 1 つのビューを別のビューに正しく再投影することを強制することで、純粋にビデオまたはステレオ ペアから深さを学習する自己教師ありの 2 種類があります。 MiDaS や Depth Anything などの最近の基盤モデルは、目に見えないシーン全体で驚くほど一般化されています。

技術的な洞察

自己教師ありメソッドは、ラベルの代わりにジオメトリを利用します。 2 つのビュー (ステレオまたは連続ビデオ フレーム) と予測された深度マップとカメラの動きが与えられると、モデルは一方の画像をワープしてもう一方の画像を再構築します。ピクセルレベルの再構成誤差がトレーニング信号になります。この「ビュー合成」の損失は、ラベルのない生のビデオから奥行きを学習できることを意味します。主な制限はスケールの曖昧さです。単眼の深度は、既知の基準または測定基準に対して校正されない限り、未知の乗数までしか正確でないことがよくあります。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

単眼の深さ推定の将来

何百万もの混合画像でトレーニングされたジェネラリストの深度基礎モデルは、トレーニングでは決して見られなかったものであっても、あらゆるシーンで信頼性の高いメトリック (真スケール) 深度を目指しています。フル 3D シーン再構築のためのオプティカル フローと SLAM の緊密な融合、電話やヘッドセットでライブ実行される軽量モデル、および強力なゼロショット堅牢性が期待されます。これにより、高価な深度センシング装置ではなく、単一のカメラから豊かな空間認識が安価かつ遍在的に利用できるようになります。

現実世界の実装

被写体と背景の距離を推定して背景のぼけ(ボケ)をシミュレートするスマートフォンのポートレートモード

現実世界の家具の後ろに正しく収まるように仮想オブジェクトを配置する拡張現実アプリ

単一の前向きカメラを使用して障害物を回避するドローンと低コストのロボット

立体表示用のピクセルごとの深度を推測することにより、2D 写真やフィルムを 3D に変換します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ステレオ深度の推定

よくある質問

What is Monocular Depth Estimation?

単眼の深度推定は、すべてのピクセルが 1 枚の通常の写真からどれだけ離れているかを予測します。ステレオ カメラ、LIDAR、深度センサーは必要ありません。 1 台のカメラで平面的な 2D 画像から 3D 構造を認識できます。

深度推定が「単眼」になるのはなぜですか?

「単眼」とは、1 つの目/カメラを意味します。この方法では、ステレオまたはアクティブな深度センサーを使用せずに、単一の RGB 画像から深度を予測します。

単眼の奥行き推定はなぜ根本的に曖昧なのでしょうか?

単一の 2D 投影ではスケール情報が失われるため、複数の 3D 配置が 1 つの画像と一致します。ネットワークは曖昧さを解消するために学習された事前分布に依存します。

自己教師あり手法は、グラウンドトゥルースのラベルなしでどのようにして深さを学習するのでしょうか?

モデルは、予測された深度とカメラの動きを使用して、ある画像を別の画像に再投影します。測光誤差は学習信号を提供し、ラベルは必要ありません。

単眼ネットワークが深度に関して直接依存しない手がかりはどれですか?

ステレオ視差には 2 台のカメラが必要です。単眼法は、サイズ、遠近感、テクスチャ、オクルージョンなどの単一画像の手がかりに依存します。

単眼深度における「スケールの曖昧さ」とは何ですか?

計量的な監視や既知の基準がなければ、単眼の深さは正しい相対構造を与えますが、絶対的なスケールは不確かです。