ビジュアルAIガイド

ステレオ深度の推定

ステレオ深度推定は、人間の両目が行うのと同じように、わずかにオフセットされた 2 つのカメラ ビューを比較することによって、物体がどれだけ離れているかを回復します。

2分の読書最終更新日

概要

It turns flat images into 3D distance maps that robots, cars, and phones rely on to understand space.

ディープダイブ

ステレオ深度推定では、固定距離(ベースライン)離れた 2 台のカメラを使用します。世界の同じ点が左右の画像でわずかに異なる水平位置に到達し、そのずれを視差と呼びます。近くの物体は大きく移動します。遠くのものはほとんど動きません。深度は (焦点距離 x ベースライン) / 視差として計算されるため、深度と視差は反比例の関係にあります。難しいのは、2 つの画像間でピクセルを一致させることです。特に、多くのピクセルが同一に見える無地の壁、繰り返しのパターン、反射面などではそう言えます。セミグローバル マッチングなどの古典的な手法は走査線に沿ってスキャンしますが、PSMNet や RAFT-Stereo などの最新のディープ ネットワークは豊富な特徴を学習して視差を反復的に調整し、扱いにくい領域でも高密度で正確な深度を生成します。

技術的な洞察

両方の画像が最初に修正されるため、一致する点が同じ水平行に配置され、検索が 1 次元に削減されます。コスト ボリュームは、ピクセルごとに各候補の視差をテストし、左右の特徴がどの程度一致しているかを測定することによって構築されます。ネットワークは、3D 畳み込みまたは反復更新を使用してこのボリュームを集約し、視差に対してソフト引数を取得してサブピクセル精度を取得します。視差と深度の反比例の関係は、遠方の深度が近くの深度よりも本質的にノイズが多いことを意味します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

ステレオ深度推定の将来

ステレオと LiDAR、レーダー、および単眼キューの緊密な融合が期待され、1 つのセンサーが故障した場合でもシステムが正常に機能低下します。トランスフォーマーベースのマッチングと自己教師ありトレーニング (グラウンドトゥルースの深さを持たない生のビデオから学習) により、高価なラベル付きデータの必要性が削減されます。オンデバイスの効率は急速に向上しており、ドローン、AR メガネ、安価なロボットにリアルタイム ステレオが搭載されています。イベント カメラと学習されたアクティブ パターンは、今日の手法を打ち破る低光量、モーション ブラー、テクスチャレス シーンでも信頼性の高い深度を約束します。

現実世界の実装

自動運転および運転支援システムは、ステレオ カメラを使用して車、歩行者、縁石までの距離を測定し、ブレーキや車線維持を行います。

倉庫ロボットや農業ロボットは 3D マップを構築して、物体をつかみ、障害物を回避し、適切な深さで果物を収穫します。

パススルー デバイスなどの AR/VR ヘッドセットは部屋の形状を推定するため、仮想オブジェクトが実際の表面に正しく配置されます。

火星探査車 (パーサヴィアランスなど) は、ステレオ ナビゲーション カメラを使用して、GPS を使用せずに岩だらけの地形上の安全な経路を計画します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stereo Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

マリーゴールドの拡散深さの推定

よくある質問

What is Stereo Depth Estimation?

ステレオ深度推定は、人間の両目が行うのと同じように、わずかにオフセットされた 2 つのカメラ ビューを比較することによって、物体がどれだけ離れているかを回復します。平面画像を 3D 距離マップに変換し、ロボット、自動車、携帯電話が空間を理解するために使用します。

立体視における「視差」とは何ですか?

視差は、対応する点が 2 つの修正されたビュー間で水平方向にどれだけ移動するかです。視差が大きいほど、オブジェクトが近くにあることを意味します。

深さは格差とどのように関係するのでしょうか?

深度 = (焦点距離 x ベースライン) / 視差なので、視差が縮小すると、推定深度は増加します。遠くの物体にはわずかな差があります。

マッチング前に画像が「修正」されるのはなぜですか?

修正により両方の画像がワープされるため、一致が 1 つの水平線に限定され、2D 検索が高速な 1D 検索に変わります。

ステレオマッチングで最も難しいシナリオはどれですか?

テクスチャのないサーフェスや繰り返しのあるサーフェスでは、多くのピクセルが同一に見えるため、アルゴリズムは正確な一致を自信を持って見つけることができません。

「ベースライン」とは何を指しますか?

ベースラインは 2 つのカメラ中心間の距離です。ベースラインが広いと、遠くのオブジェクトの精度が向上します。