立體深度估計
立體深度估計透過比較兩個稍微偏移的相機視圖來恢復物體的距離,就像您的兩隻眼睛一樣。
概述
它將平面圖像轉換為機器人、汽車和手機用來了解空間的 3D 距離圖。
深入探討
立體深度估計使用兩台相距固定距離(基線)的相機。世界上的同一點在左右影像中的水平位置略有不同,這種移動稱為視差。附近的物體移動很多;遠處的人幾乎不動。深度的計算公式為(焦距 x 基線)/視差,因此深度和視差呈現反比關係。困難的部分是匹配兩個影像之間的像素,尤其是在平坦的牆壁、重複圖案或許多像素看起來相同的反射表面上。半全域匹配等經典方法沿著掃描線掃描,而 PSMNet 和 RAFT-Stereo 等現代深度網路則學習豐富的特徵並迭代地細化視差,即使在棘手的區域也能產生密集、準確的深度。
技術洞察
首先對兩個影像進行校正,使匹配點位於同一水平行,從而將搜尋減少到一維。透過測試每個像素的每個候選視差,測量左右特徵的一致性程度來建立成本量。網路透過 3D 卷積或循環更新來聚合該體積,然後對視差進行軟精算以獲得子像素精度。視差和深度之間的反比關係意味著遠處的深度本質上比近處的深度雜訊更大。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
立體深度估計的未來
預計立體聲與光達、雷達和單目線索會更緊密地融合,這樣當一個感測器發生故障時,系統就會優雅地降級。基於 Transformer 的配對和自我監督訓練(從沒有真實深度的原始影片中學習)正在減少對昂貴的標記資料的需求。設備上的效率正在快速提高,為無人機、AR 眼鏡和廉價機器人提供了即時立體聲。即使在低光源、運動模糊和無紋理場景中,事件相機和學習的活動模式也能保證可靠的深度,而這些都擊敗了當今的方法。
現實世界的實施
自動駕駛和駕駛員輔助系統使用立體攝影機來測量與汽車、行人和路緣石的距離,以進行煞車和車道保持。
倉庫和農業機器人建立 3D 地圖來抓取物件、避開障礙物並在正確的深度採摘水果。
AR/VR 耳機(例如直通設備)可以估計房間的幾何形狀,以便虛擬物件正確地放置在真實表面上。
火星漫遊車(例如「毅力號」)使用立體導航相機在沒有 GPS 的情況下在岩石地形上規劃安全路徑。
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stereo Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是立體深度估計?
立體深度估計透過比較兩個稍微偏移的相機視圖來恢復物體的距離,就像您的兩隻眼睛一樣。它將平面圖像轉換為機器人、汽車和手機用來了解空間的 3D 距離圖。
什麼是立體視覺的「視差」?
視差是對應點在兩個校正視圖之間水平移動的距離;視差越大意味著物體越近。
深度與視差有何關係?
深度 =(焦距 x 基線)/視差,因此當視差縮小時,估計深度會增加。遠處的物體差異很小。
為什麼在匹配之前要對影像進行「校正」?
校正會扭曲兩個影像,因此匹配僅限於一條水平線,從而將 2D 搜尋轉變為快速的 1D 搜尋。
哪一種場景立體配對最難?
無紋理或重複的表面使許多像素看起來相同,因此演算法無法自信地找到正確的匹配。
「基線」指的是什麼?
基線是兩個相機中心之間的距離;更寬的基線可以提高遠處物體的準確性。