视觉SLAM
视觉 SLAM 让移动摄像机构建未知空间的地图,同时跟踪其自身在该地图内的位置。
概述
It is the spatial backbone of robots, drones, AR headsets, and self-driving features.
深入探讨
SLAM 代表同步定位和建图,视觉变体使用摄像头而不是(或并排)激光雷达或雷达来解决这个问题。当相机移动时,系统会检测角和边缘等独特特征,将它们跨帧进行匹配,并使用这些点的表观运动来估计场景的 3D 结构和相机的轨迹。困难的部分是先有鸡还是先有蛋的耦合:你需要一张地图来知道你在哪里,但你需要知道你在哪里才能构建地图。视觉 SLAM 共同解决这个问题,通常会同时完善数千个点和姿势。它为 ARKit、ARCore、Meta Quest 的由内而外跟踪、火星漫游者和仓库机器人提供动力,在 GPS 出现故障的室内工作。
技术洞察
典型的管道具有逐帧跟踪特征的前端(使用 ORB、SIFT 或直接光度测量方法)和优化贴图的后端。捆绑调整共同最大限度地减少了许多相机姿势和 3D 点的重投影误差,而环路闭合则检测相机何时重新访问某个位置并纠正累积的漂移。单目 SLAM 无法恢复绝对尺度,因此需要融合立体相机或惯性测量单元 (IMU) 来修复它。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
视觉 SLAM 的未来
该领域正在从手工制作的特征匹配转向学习特征、学习深度和端到端神经 SLAM,后者对无纹理墙壁、运动模糊和变化的光线更加鲁棒。神经辐射场和高斯分布正在被融合到 SLAM 中,以生成密集、逼真的地图,而不是稀疏的点云。预计手机和耳机上会出现更紧密的视觉惯性融合,加上标记对象的语义 SLAM,使机器人能够推理场景,而不仅仅是导航其几何形状。
现实世界的实施
在 Meta Quest 和 Apple Vision Pro 耳机上进行由内而外的位置跟踪,在没有外部基站的房间中定位用户
Apple ARKit 和 Google ARCore 将虚拟家具或游戏角色锚定到手机上的真实地板和桌子上
NASA 的火星漫游车使用视觉里程计和地图来导航没有 GPS 的地形
自主仓库机器人和室内送货机器人构建楼层地图并在货架之间进行定位
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual SLAM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Visual SLAM?
视觉 SLAM 让移动摄像机构建未知空间的地图,同时跟踪其自身在该地图内的位置。它是机器人、无人机、AR 耳机和自动驾驶功能的空间支柱。
SLAM 缩写代表什么?
SLAM 的意思是同时定位和建图:构建地图的同时确定您在其中的位置。
为什么单目(单摄像头)视觉SLAM无法自行恢复绝对尺度?
使用一台摄像机且没有其他提示时,附近的小场景和远处的大场景可能看起来相同,因此如果没有立体声或 IMU,真正的公制比例是不明确的。
SLAM 系统中闭环的目的是什么?
微小的跟踪误差随着时间的推移会累积为漂移;检测到摄像机已返回已知地点后,系统可以纠正整个轨迹。
SLAM后端的bundle adjustment优化了什么?
捆绑调整联合细化了许多摄像机位置和地图点,以便投影的 3D 点与图像中实际出现的特征最佳匹配。
为什么视觉 SLAM 中经常将 IMU(惯性测量单元)与相机融合?
加速计和陀螺仪提供运动估计,通过运动模糊稳定跟踪并帮助解决比例问题,这是单个相机无法做到的。