Розповсюдження нових поглядів від нуля 1 до 3
Zero 1-to-3 перетворює одну фотографію об’єкта на зображення того самого об’єкта під будь-яким новим кутом, використовуючи модель дифузії, залежно від повороту камери, який ви зажадаєте.
Огляд
It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.
Глибоке занурення
Zero-1-to-3 (від Columbia, 2023) точно налаштовує стабільну дифузію, щоб він міг виконувати нульовий синтез нового зображення з одного вхідного зображення. Ви подаєте в нього одне зображення плюс відносне перетворення камери (обертання та невелике переміщення), і модель генерує те, як виглядатиме об’єкт із цієї нової точки зору. Ключова ідея полягає в тому, що великі 2D-моделі дифузії, навчені на величезних колекціях веб-зображень, неявно засвоїли геометричні та фізичні знання про те, як об’єкти виглядають у 3D. Завдяки тонкому налаштуванню синтетичного набору даних об’єктів, візуалізованих під багатьма контрольованими кутами камери (за допомогою Objaverse), модель вчиться відображати ці попередні параметри на явне керування камерою. Згенеровані види можуть потім передаватись у подальшу 3D-реконструкцію.
Технічне розуміння
Умови моделі на вихідному зображенні двома способами: вбудовування CLIP об’єднується з відносною позицією камери (азимут, висота, радіус), щоб спрямовувати перехресну увагу, тоді як необроблене зображення об’єднується за каналом до прихованого шуму, щоб збереглися дрібні деталі та ідентичність. Навчання використовує триплети «зображення-поза-зображення», отримані з об’єктів САПР, тому мережа вивчає кероване відображення між зміною точки огляду та кінцевою зміною пікселя.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє розповсюдження нових поглядів від нуля 1 до 3
Zero-1-to-3 породив хвилю конвеєрів із зображення в 3D. Наступники, такі як Zero123-XL, SyncDreamer і One-2-3-45, прагнуть до узгодженості кількох зображень і швидшого, надійнішого виводу 3D-сітки, тоді як інтеграція з Gaussian Splatting і моделями великої реконструкції скорочує час генерації з хвилин до секунд. Очікуйте чіткішої узгодженості перегляду, вищої роздільної здатності та узагальнення реального світу (а не лише синтетичного об’єкта), оскільки ці моделі розповсюдження, керовані точками огляду, стають стандартними інструментами для створення вмісту.
Реалізація в реальному світі
Створення поворотної таблиці однієї фотографії продукту, щоб в списку електронної комерції можна було побачити товар з усіх боків
Завантаження текстурованої 3D-сітки об’єкта з одного звичайного знімка телефону для попереднього перегляду AR
Створення узгодженого багаторакурсного еталонного зображення персонажа чи реквізиту для концепт-художників ігор і фільмів
Введення синтезованих нових видів у реконструкцію NeRF або Gaussian Splatting для заповнення невидимої геометрії
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Синтез роману
Часті запитання
What is Zero-1-to-3 Novel View Diffusion?
Zero 1-to-3 перетворює одну фотографію об’єкта на зображення того самого об’єкта під будь-яким новим кутом, використовуючи модель дифузії, залежно від повороту камери, який ви зажадаєте. Це важливо, оскільки дозволяє реконструювати узгоджені 3D-види без сканування об’єкта з кількох боків.
Які основні вхідні дані потрібні Zero-1-to-3 на додаток до одного зображення для створення нового перегляду?
Нуль від 1 до 3 залежить від одного зображення та відносної пози камери, тому ви вказуєте поворот і переміщення до потрібної точки огляду.
Від нуля до 3 створюється шляхом тонкого налаштування якої моделі?
Він точно налаштовує велику попередньо навчену 2D-модель дифузії, щоб можна було використовувати попередні геометричні параметри, отримані цими моделями з веб-зображень.
Чому 2D дифузійна модель взагалі може здійснювати нульовий синтез нового виду?
Широкомасштабне 2D-навчання передає неявні знання про те, як об’єкти виглядають у 3D, точне налаштування яких дозволяє керувати за допомогою пози камери.
Який набір даних 3D-об’єктів був основним для навчання Zero-1-to-3?
Його було навчено на триплетах зображення-поза-зображення, рендерених із великих колекцій синтетичних 3D-об’єктів, таких як Objaverse.
Як дрібні деталі вихідного зображення зберігаються під час створення?
Необроблене зображення з’єднане каналом із шумовим латентом (разом із вбудованим CLIP для семантики), тому ідентичність і деталі проходять.