視覺人工智慧指南

运动结构

運動結構 (SfM) 根據從不同視點拍攝的一組重疊 2D 照片重建 3D 場景幾何形狀和相機位置。

閱讀時間約2分鐘最後更新

概述

It is the backbone of 3D mapping, photogrammetry, and modern reconstruction pipelines.

深入探討

SfM 同時解決兩個耦合的未知數:每個相機拍攝照片時的位置,以及世界中 3D 點的位置。它首先檢測每張影像中的獨特特徵點(使用 SIFT 等偵測器),然後在多張照片中匹配相同的物理點。利用這些對應關係以及 3D 點如何投影到 2D 影像上的幾何形狀,系統透過對極幾何形狀估計相對相機位姿。點被三角測量成稀疏的 3D 雲,並且稱為束調整的全局最佳化將所有攝影機和點一起細化,以最大限度地減少重投影誤差。結果是稀疏的點雲加上校準的相機位置——這是更密集的重建方法所依賴的基本支架。

技術洞察

SfM 的數學核心是捆綁調整:一種大型非線性最小二乘優化,可同時調整每個相機的位姿和內在特性以及每個 3D 點,以便它們的投影與觀察到的 2D 特徵位置最匹配。它最大限度地減少了「重投影誤差」——影像中某個點的著陸位置與當前 3D 估計值表明該點應該著陸的位置之間的像素距離——通常透過 Levenberg-Marquardt 實現。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

運動結構的未來

SfM 越來越多地與深度學習融合:學習的特徵檢測器和匹配器(如 SuperPoint 和 SuperGlue)可以處理經典 SIFT 難以處理的無紋理或重複場景。它還提供神經場景表示,例如 NeRF 和 Gaussian Splatting,這需要 SfM 提供的相機姿勢。預計更快、更強大的端到端管道、用於 AR 的手機上的即時 SfM,以及與 SLAM 的更緊密耦合,以實現機器人和自主導航中的即時地圖繪製。

現實世界的實施

無人機攝影測量將航空照片集轉換為 3D 地形並建立測量模型

恢復相機姿勢以引導 NeRF 和高斯潑濺場景重建

將文化遺產遺址和雕像數位化保存為旅遊照片集中的 3D 模型

根據調查人員的照片重建 3D 犯罪或事故現場以進行法醫分析

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Structure from Motion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

AnimateDiff 運動生成

常見問題

What is Structure from Motion?

運動結構 (SfM) 根據從不同視點拍攝的一組重疊 2D 照片重建 3D 場景幾何形狀和相機位置。它是 3D 測繪、攝影測量和現代重建流程的支柱。

Structure from Motion 同時估計哪兩件事?

SfM 聯合求解場景的 3D 幾何形狀以及每個攝影機捕捉每個影像時的位置。

特徵匹配在SfM中的作用是什麼?

匹配照片中偵測到的特徵(例如 SIFT 關鍵點)可以提供推斷幾何形狀所需的對應關係。

捆綁調整優化了什麼?

束調整是一種全局非線性最小二乘細化,可最小化觀察點和投影點之間的像素間隙。

SfM 通常直接產生哪一種 3D 輸出?

SfM 產生一組稀疏的三角點和相機位置;完整表面需要更密集的方法。

哪個幾何概念關聯兩個相機視圖之間的對應點?

對極幾何限制了一幅影像中看到的點可以出現在另一個影像中的位置,從而實現姿態估計。