Оценка глубины диффузии бархатцев
Мэриголд перепрофилирует предварительно обученную модель диффузии для генерации изображений (Stable Diffusion) для прогнозирования очень подробных карт глубины.
Обзор
It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.
Глубокое погружение
Мэриголд (ETH Zurich, поощрительная премия CVPR 2024 за лучшую статью) переосмысливает оценку глубины как задачу условной генерации. Вместо обучения сети глубины с нуля он настраивает Stable Diffusion для «создания» карты глубины на основе входного изображения. Идея заключается в том, что модель, обученная синтезировать фотореалистичные изображения, уже изучила геометрию сцены, освещение и структуру глубоко в ее скрытом пространстве, то есть именно те априорные значения, которые полезны для глубины. Примечательно, что Marigold был настроен только на синтетические наборы данных (такие как Hypersim и Virtual KITTI), но при этом хорошо обобщает реальные фотографии с нуля. Он создает аффинно-инвариантную относительную глубину с исключительно мелкой детализацией, хотя итеративное шумоподавление делает его медленнее, чем модели с прямой связью, такие как DepthAnything.
Техническая информация
Мэриголд действует в скрытом пространстве Стабильной Диффузии. И изображение, и карта глубины кодируются одним и тем же VAE; U-Net точно настроен на подавление скрытой глубины, зависящей от скрытого чистого изображения. При выводе он запускает стандартный итеративный цикл шумоподавления, а затем декодирует скрытую глубину. Поскольку это выборка, несколько прогонов можно объединить для обеспечения стабильности, жертвуя вычислениями ради точности. Более поздние версии «LCM» и одноступенчатой дистилляции сократили десятки ступеней до одного прохода.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее оценки глубины диффузии бархатцев
Рецепт Мэриголд, точная настройка априорной диффузии для плотного предсказания, обобщает не только глубину, но и нормали к поверхности, внутреннее разложение изображения и оценку материала. Более быстрые варианты моделей согласованности сокращают разрыв в скорости с помощью сетей прямой связи, делая восприятие, основанное на диффузии, жизнеспособным в интерактивных инструментах. Ожидайте более широкой тенденции, когда одна предварительно обученная генеративная основа адаптируется ко многим задачам геометрии и восприятия, что снижает потребность в больших наборах данных с метками для конкретных задач.
Реальная реализация
Извлечение детальной глубины из архитектурных фотографий и фотографий продуктов для переосвещения и 3D-макетов.
Создание высокодетализированных карт глубины, используемых в качестве условий для контролируемой генерации изображений и видео.
Помощь командам, работающим с фильмами и визуальными эффектами, в работе с матовой поверхностью и параллаксом, где важна точность краев.
Служит основой для исследований, показывающих, как адаптировать генеративные априоры к задачам плотного прогнозирования.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Marigold Diffusion Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Монокулярная оценка глубины
Часто задаваемые вопросы
What is Marigold Diffusion Depth Estimation?
Мэриголд перепрофилирует предварительно обученную модель диффузии для генерации изображений (Stable Diffusion) для прогнозирования очень подробных карт глубины. Это показывает, что вы можете превратить богатые визуальные знания генератора в точный инструмент восприятия с удивительно небольшим количеством обучающих данных.
На какой предварительно обученной модели построена Мэриголд?
Мэриголд настраивает модель скрытой диффузии Stable Diffusion для создания карт глубины.
Как Мэриголд формулирует задачу оценки глубины?
Он рассматривает глубину как нечто, что нужно «сгенерировать» на основе входного изображения, повторно используя механизм диффузии.
Что же удивительного в данных о тренировках Мэриголд?
Marigold была точно настроена на синтетических данных, таких как Hypersim и Virtual KITTI, но обобщает нулевой снимок на реальные фотографии.
Почему Marigold обычно работает медленнее, чем модели глубины с прямой связью?
Модели диффузии удаляют шум за несколько шагов, что делает вывод медленнее, чем один прямой проход.
В каком пространстве Мэриголд осуществляет процесс диффузии?
И изображение, и глубина кодируются в скрытом пространстве VAE, где U-Net подавляет шум.