Визуальное руководство по искусственному интеллекту

Монокулярная оценка глубины

Монокулярная оценка глубины предсказывает, насколько далеко каждый пиксель находится от одной обычной фотографии — при этом не требуется стереокамера, лидар или датчик глубины.

2 минуты чтенияПоследнее обновление

Обзор

Она позволяет одной камере воспринимать 3D-структуру с плоского двумерного изображения.

Глубокое погружение

Люди могут судить о глубине по одному глазу, используя такие признаки, как перспектива, относительный размер, градиенты текстуры, затенение и окклюзия. Монокулярная оценка глубины учит нейронные сети тому же трюку: подавать одно изображение RGB и выводить значение глубины для каждого пикселя. Поскольку 2D-изображение по своей сути не имеет однозначного определения абсолютного масштаба, задача усложняется: на одно и то же изображение может проецироваться множество 3D-сцен. Чтобы решить эту проблему, сети изучают статистические априорные данные из больших наборов данных. Training comes in two flavors: supervised, using ground-truth depth from lidar or RGB-D sensors, and self-supervised, which learns depth purely from video or stereo pairs by enforcing that the predicted depth correctly reprojects one view into another. Последние базовые модели, такие как MiDaS и Depth Anything, замечательно обобщают невидимые сцены.

Техническая информация

Методы самоконтроля используют геометрию вместо меток. Учитывая два вида (стерео или последовательные видеокадры) и прогнозируемую карту глубины плюс движение камеры, модель искажает одно изображение, чтобы восстановить другое; the pixel-level reconstruction error becomes the training signal. Эта потеря «синтеза просмотра» означает, что глубину можно узнать из необработанного, неразмеченного видео. Ключевым ограничением является неоднозначность шкалы: монокулярная глубина часто бывает правильной только до неизвестного множителя, если она не откалибрована по известному эталону или метрическому контролю.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее монокулярной оценки глубины

Общие модели глубины, обученные на миллионах смешанных изображений, стремятся к надежной, метрической (истинной шкале) глубине в любой сцене, даже в тех, которые никогда не наблюдались при обучении. Ожидайте более тесного объединения оптического потока и SLAM для полной реконструкции 3D-сцен, более легких моделей, которые будут работать в реальном времени на телефонах и гарнитурах, а также более высокой надежности при нулевом снимке. Это сделает богатое пространственное восприятие дешевым и повсеместным, доступным с любой отдельной камеры, а не с дорогих установок для измерения глубины.

Реальная реализация

Портретный режим смартфона, имитирующий размытие фона (боке) путем оценки расстояния между объектом и фоном

Приложения дополненной реальности размещают виртуальные объекты так, чтобы они правильно располагались за реальной мебелью.

Дроны и недорогие роботы обходят препятствия с помощью одной фронтальной камеры

Преобразование 2D-фотографий и фильмов в 3D путем определения глубины каждого пикселя для стереоскопического отображения.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Оценка стерео глубины

Часто задаваемые вопросы

Что такое оценка монокулярной глубины?

Монокулярная оценка глубины предсказывает, насколько далеко каждый пиксель находится от одной обычной фотографии — при этом не требуется стереокамера, лидар или датчик глубины. Это позволяет одной камере воспринимать трехмерную структуру из плоского двухмерного изображения.

Что делает оценку глубины «монокулярной»?

«Монокуляр» означает один глаз/камеру; метод прогнозирует глубину по одному изображению RGB без стерео или активных датчиков глубины.

Почему монокулярная оценка глубины принципиально неоднозначна?

В одной 2D-проекции теряется информация о масштабе, поэтому несколько 3D-конфигураций соответствуют одному изображению; сети полагаются на полученные знания для устранения неоднозначности.

Как методы самоконтроля изучают глубину без ярлыков базовой истины?

Используя прогнозируемую глубину и движение камеры, модель проецирует одно изображение на другое; фотометрическая ошибка обеспечивает обучающий сигнал, метки не нужны.

На какой сигнал монокулярные сети НЕ полагаются напрямую для определения глубины?

Для стереодиспропорции требуются две камеры; монокулярные методы полагаются на такие сигналы одного изображения, как размер, перспектива, текстура и окклюзия.

Что такое «неоднозначность масштаба» монокулярной глубины?

Без метрического контроля или известного эталона монокулярная глубина дает правильную относительную структуру, но неопределенную абсолютную шкалу.