视觉人工智能指南

运动结构

运动结构 (SfM) 根据从不同视点拍摄的一组重叠 2D 照片重建 3D 场景几何形状和相机位置。

阅读时间:2分钟最后更新

概述

它是3D制图、摄影测量和现代重建管道的骨干。

深入探讨

SfM solves two coupled unknowns at once: where each camera was when it took a photo, and where 3D points in the world are located.它首先检测每张图像中的独特特征点(使用 SIFT 等检测器),然后在多张照片中匹配相同的物理点。利用这些对应关系以及 3D 点如何投影到 2D 图像上的几何形状,系统通过对极几何形状估计相对相机位姿。点被三角测量成稀疏的 3D 云,并且称为束调整的全局优化将所有摄像机和点一起细化,以最大限度地减少重投影误差。 The result is a sparse point cloud plus calibrated camera positions — the essential scaffold that denser reconstruction methods build upon.

技术洞察

SfM 的数学核心是捆绑调整:一种大型非线性最小二乘优化,可同时调整每个相机的位姿和内在特性以及每个 3D 点,以便它们的投影与观察到的 2D 特征位置最匹配。它最大限度地减少了“重投影误差”——图像中某个点的着陆位置与当前 3D 估计表明该点应该着陆的位置之间的像素距离——通常通过 Levenberg-Marquardt 实现。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

运动结构的未来

SfM 越来越多地与深度学习融合:学习的特征检测器和匹配器(如 SuperPoint 和 SuperGlue)可以处理经典 SIFT 难以处理的无纹理或重复场景。 It also feeds neural scene representations such as NeRF and Gaussian Splatting, which need the camera poses SfM provides.预计更快、更强大的端到端管道、用于 AR 的手机上的实时 SfM,以及与 SLAM 的更紧密耦合,以实现机器人和自主导航中的实时地图绘制。

现实世界的实施

无人机摄影测量将航空照片集转化为 3D 地形并构建测量模型

恢复相机姿势以引导 NeRF 和高斯泼溅场景重建

将文化遗产遗址和雕像数字化保存为旅游照片集中的 3D 模型

根据调查人员的照片重建 3D 犯罪或事故现场以进行法医分析

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Structure from Motion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

AnimateDiff 运动生成

常见问题

什么是运动中的结构?

运动结构 (SfM) 根据从不同视点拍摄的一组重叠 2D 照片重建 3D 场景几何形状和相机位置。 It is the backbone of 3D mapping, photogrammetry, and modern reconstruction pipelines.

Structure from Motion 同时估计哪两件事?

SfM 联合求解场景的 3D 几何形状以及每个摄像机捕获每个图像时的位置。

特征匹配在SfM中的作用是什么?

匹配照片中检测到的特征(例如 SIFT 关键点)可以提供推断几何形状所需的对应关系。

捆绑调整优化了什么?

束调整是一种全局非线性最小二乘细化,可最小化观察点和投影点之间的像素间隙。

SfM 通常直接生成哪种 3D 输出?

SfM 产生一组稀疏的三角点和相机位置;完整表面需要更密集的方法。

哪个几何概念关联两个相机视图之间的对应点?

对极几何限制了一幅图像中看到的点可以出现在另一幅图像中的位置,从而实现姿态估计。