Визуальное руководство по искусственному интеллекту

Визуальный SLAM

Visual SLAM позволяет движущейся камере создавать карту неизвестного пространства, одновременно отслеживая свое собственное положение внутри этой карты.

2 минуты чтенияПоследнее обновление

Обзор

It is the spatial backbone of robots, drones, AR headsets, and self-driving features.

Глубокое погружение

SLAM означает «Одновременная локализация и картографирование», а визуальный вариант решает проблему с использованием камер вместо лидара или радара (или рядом с ними). По мере движения камеры система обнаруживает отличительные особенности, такие как углы и края, сопоставляет их по кадрам и использует видимое движение этих точек для оценки как трехмерной структуры сцены, так и траектории камеры. Самое сложное — это связь курицы и яйца: вам нужна карта, чтобы знать, где вы находитесь, но вам нужно знать, где вы находитесь, чтобы построить карту. Visual SLAM решает эту задачу совместно, часто уточняя тысячи точек и поз одновременно. Он используется в ARKit, ARCore, системе внутреннего слежения Meta Quest, марсоходах и складских роботах, работающих в помещении, где не работает GPS.

Техническая информация

Типичный конвейер имеет интерфейс, который отслеживает объекты от кадра к кадру (с использованием ORB, SIFT или прямых фотометрических методов), и серверную часть, которая оптимизирует карту. Совместная настройка пакета минимизирует ошибку перепроецирования во многих положениях камеры и трехмерных точках, а замыкание цикла определяет, когда камера повторно посещает место, и корректирует накопленный дрейф. Монокуляр SLAM не может восстановить абсолютный масштаб, поэтому для его фиксации используются стереокамеры или инерциальный измерительный блок (IMU).

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее визуального SLAM

Эта область смещается от ручного сопоставления функций к изученным функциям, изученной глубине и сквозному нейронному SLAM, который более устойчив к стенам без текстур, размытию движения и изменяющемуся освещению. Поля нейронного излучения и гауссово разбрызгивание объединяются в SLAM для создания плотных фотореалистичных карт, а не разреженных облаков точек. Ожидайте более тесного визуально-инерционного слияния на телефонах и гарнитурах, а также семантического SLAM, который маркирует объекты, что позволит роботам рассуждать о сцене, а не просто ориентироваться в ее геометрии.

Реальная реализация

Отслеживание положения изнутри наружу на Meta гарнитурах Quest и Apple Vision Pro, определение местоположения пользователя в помещении без внешних базовых станций

Apple ARKit и Google ARCore привязывают виртуальную мебель или игровых персонажей к реальным этажам и столам на телефонах

Марсоходы НАСА используют визуальную одометрию и картографирование для навигации по местности, где нет GPS

Автономные складские роботы и роботы-доставщики внутри помещений строят карты этажей и локализуются на полках.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Визуальное мышление

Часто задаваемые вопросы

What is Visual SLAM?

Visual SLAM позволяет движущейся камере создавать карту неизвестного пространства, одновременно отслеживая свое собственное положение внутри этой карты. Это пространственная основа роботов, дронов, AR-гарнитур и функций беспилотного вождения.

Что означает аббревиатура SLAM?

SLAM означает одновременную локализацию и картографирование: создание карты и одновременное определение вашего положения на ней.

Почему монокулярный (однокамерный) визуальный SLAM не может самостоятельно восстановить абсолютный масштаб?

С одной камерой и без другого сигнала небольшая ближайшая сцена и большая удаленная сцена могут выглядеть одинаково, поэтому истинная метрическая шкала неоднозначна без стерео или IMU.

Какова цель замыкания петли в системе SLAM?

Небольшие ошибки отслеживания со временем накапливаются в виде дрейфа; обнаружение того, что камера вернулась в известное место, позволяет системе скорректировать всю траекторию.

Что оптимизирует настройка пакета в серверной части SLAM?

Пакетная настройка совместно уточняет многие положения камеры и точки карты, чтобы проецируемые 3D-точки наилучшим образом соответствовали тем местам, где объекты фактически появляются на изображениях.

Почему в визуальном SLAM IMU (инерциальный измерительный блок) часто объединяется с камерами?

Акселерометры и гироскопы предоставляют оценки движения, которые стабилизируют отслеживание за счет размытия изображения и помогают определить масштаб, чего не может сделать одна камера.