Визуальное руководство по искусственному интеллекту

Распространение новых взглядов от нуля до трех

От нуля от 1 до 3 превращает одну фотографию объекта в изображения того же объекта, видимого под любым новым углом, используя диффузионную модель, обусловленную запрошенным вами поворотом камеры.

2 минуты чтенияПоследнее обновление

Обзор

Это важно, поскольку позволяет восстанавливать трехмерные изображения без необходимости сканирования объекта с нескольких сторон.

Глубокое погружение

Zero-1-to-3 (из Колумбии, 2023 г.) настраивает Stable Diffusion так, чтобы он мог выполнять синтез новых представлений с нулевым выстрелом из одного входного изображения. Вы передаете ему одно изображение плюс относительное преобразование камеры (поворот и небольшой сдвиг), и модель генерирует то, как объект будет выглядеть с этой новой точки зрения. Ключевая идея заключается в том, что большие 2D-модели диффузии, обученные на огромных коллекциях веб-изображений, неявно учитывают геометрические и физические априорные данные о том, как объекты выглядят в 3D. Путем точной настройки синтетического набора данных объектов, визуализируемых со многих контролируемых ракурсов камеры (с использованием Objaverse), модель учится сопоставлять эти априорные значения с явным управлением камерой. Сгенерированные виды затем могут использоваться для последующей 3D-реконструкции.

Техническая информация

Модель обрабатывает исходное изображение двумя способами: встраивание CLIP объединяется с относительным положением камеры (азимут, угол возвышения, радиус) для управления перекрестным вниманием, в то время как необработанное изображение объединяется по каналам со скрытым шумом, поэтому сохраняются мелкие детали и идентичность. Для обучения используются триплеты «изображение-поза-изображение», визуализированные из объектов САПР, поэтому сеть изучает контролируемое сопоставление между изменением точки обзора и результирующим изменением пикселей.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее распространения новых взглядов от нуля до трех

Переход от нуля к 3 породил волну конвейеров преобразования изображения в 3D. Преемники, такие как Zero123-XL, SyncDreamer и One-2-3-45, способствуют обеспечению согласованности нескольких представлений и более быстрому и надежному выводу трехмерных сеток, а интеграция с Gaussian Splatting и большими моделями реконструкции сокращает время генерации с минут до секунд. Ожидайте более строгой согласованности представлений, более высокого разрешения и обобщения реального мира (а не только синтетических объектов), поскольку эти модели диффузии, управляемые с точки зрения, превращаются в стандартные инструменты для создания контента.

Реальная реализация

Создание изображений одной фотографии продукта на поворотном столе, чтобы в списке электронной коммерции можно было показать товар со всех сторон.

Создание текстурированной 3D-сетки объекта из одного случайного снимка телефона для предварительного просмотра AR

Создание последовательного многоракурсного эталонного изображения персонажа или реквизита для концепт-художников игр и фильмов.

Вставка синтезированных новых представлений в реконструкцию NeRF или Gaussian Splatting для заполнения невидимой геометрии.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Синтез новых представлений

Часто задаваемые вопросы

Что такое распространение взглядов на роман от нуля до трех?

От нуля от 1 до 3 превращает одну фотографию объекта в изображения того же объекта, видимого под любым новым углом, используя диффузионную модель, обусловленную запрошенным вами поворотом камеры. Это важно, поскольку позволяет восстанавливать трехмерные изображения без необходимости сканирования объекта с нескольких сторон.

Какие основные входные данные необходимы для процесса «от нуля до трех» в дополнение к одному изображению для создания нового представления?

От нуля до трех зависит от одного изображения плюс относительная поза камеры, поэтому вы указываете вращение и перемещение к желаемой точке обзора.

От нуля до трех построена путем тонкой настройки какой модели?

Он настраивает большую предварительно обученную 2D-модель диффузии, чтобы она могла использовать геометрические априорные данные, которые эти модели неявно извлекли из веб-изображений.

Почему двумерная диффузионная модель вообще может выполнять синтез нового представления с нулевым выстрелом?

Масштабное 2D-обучение дает неявные знания о том, как объекты выглядят в 3D, а точная настройка позволяет управлять ими с помощью позы камеры.

Какой набор данных 3D-объектов был центральным для обучения «от нуля до трех»?

Он обучался на тройках изображение-поза-изображение, полученных из больших синтетических коллекций 3D-объектов, таких как Objaverse.

Как при генерации сохраняются мелкие детали исходного изображения?

Необработанное изображение объединяется по каналам со скрытым шумом (наряду с внедрением CLIP для семантики), поэтому сохраняется идентичность и детализация.