Візуальний AI GUIDE

DreamFusion і Score Distillation Sampling

DreamFusion створює 3D-об’єкти з тексту, використовуючи модель розповсюдження 2D-зображення як критику, ніколи не навчаючись на будь-яких 3D-даних.

2 хвилини читанняОстаннє оновлення

Огляд

Його основний винахід, Score Distillation Sampling, став основою для всього напряму тексту у 3D.

Глибоке занурення

DreamFusion з Google у 2022 році запитав: чи може 2D-модель із перетворенням тексту в зображення навчити 3D-сцену виглядати правильно під будь-яким кутом? Він оптимізує NeRF (поле нейронного випромінювання), щоб візуалізації з випадкових точок огляду камери, коли вони зашумлені та показані на моделі замороженої дифузії (Imagen), оцінювалися як правдоподібні зображення для текстової підказки. Важливо, що він не використовує дані 3D навчання. Проривом є Score Distillation Sampling (SDS): замість зворотного поширення через дорогу мережу U-Net дифузійної моделі, SDS використовує прогнозований шум моделі як градієнтний сигнал безпосередньо на візуалізованих пікселях. Ітерація цього в тисячах точок огляду формує послідовний 3D-ресурс із геометрією та зовнішнім виглядом, що залежить від виду, з одного речення.

Технічне розуміння

SDS розглядає дифузійну модель як заморожену функцію оцінки. Він візуалізує NeRF, додає шум, просить дифузійну мережу U-Net передбачити цей шум і обчислює градієнт (прогнозований шум мінус доданий шум) повертається на відтворене зображення і, отже, ваги NeRF. Пропуск U-Net Jacobian робить його доступним. Високі вказівки без класифікатора (близько 100) необхідні для чітких результатів, що спричиняє характерний перенасичений, іноді розмитий «вигляд DreamFusion».

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє DreamFusion і відбір проб Score Distillation

SDS створила багатий набір робіт, щоб виправити свої недоліки: Magic3D для роздільної здатності та швидкості, ProlificDreamer's Variational Score Distillation для чіткішого та різноманітнішого результату та методи атаки на багатогранний артефакт «Янус». Поле все частіше поєднує SDS з попередніми програмами дифузії з кількома видами та швидкими тривимірними представленнями, такими як Gaussian Splatting. Очікуйте, що перетворення тексту в 3D стане швидшим і геометрично точнішим, скорочуючи розрив із змодельованими вручну ресурсами.

Реалізація в реальному світі

Створення 3D-моделі «фотографії DSLR білки в крихітному капелюшку» лише з тексту

Створення чорнових ігор і ресурсів AR без ручного 3D-скульптування

Створення сіток для експорту, які художники вдосконалюють замість створення з нуля

Дослідження бази для оцінки нових методів перетворення тексту в 3D порівняно з SDS

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DreamFusion and Score Distillation Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Генеративні моделі на основі балів

Часті запитання

Що таке DreamFusion та Score Distillation Sempling?

DreamFusion створює 3D-об’єкти з тексту, використовуючи модель розповсюдження 2D-зображення як критику, ніколи не навчаючись на будь-яких 3D-даних. Його основний винахід, Score Distillation Sampling, став основоположним рецептом для всього поля перетворення тексту в 3D.

Яке тривимірне представлення оптимізує DreamFusion?

DreamFusion оптимізує NeRF, щоб його візуалізовані види задовольняли судження моделі 2D дифузії щодо текстового підказки.

Скільки тренувальних 3D даних вимагає DreamFusion?

DreamFusion використовує заморожену 2D-модель розповсюдження тексту в зображення як єдиний нагляд, не потребуючи даних для 3D-навчання.

Яке ключове скорочення обчислень у Score Distillation Sampling?

SDS використовує передбачений мінус доданий шум як прямий градієнт на візуалізованих пікселях, уникаючи дорогого U-Net Jacobian.

Чому DreamFusion використовує дуже високі вказівки без класифікаторів (~100)?

Градієнт SDS є шумним і слабким, тому необхідне надзвичайно високе керівництво для чіткої, швидкої геометрії, хоча це спричиняє перенасичення.

Яку 2D-модель використовував оригінальний DreamFusion як заморожений попередній?

DreamFusion було створено на основі моделі розповсюдження тексту в зображення Imagen від Google як функцію замороженого оцінювання.