Визуальное руководство по искусственному интеллекту

DreamFusion и Score дистилляционная выборка

DreamFusion генерирует 3D-объекты из текста, используя в качестве критика модель диффузии 2D-изображений, никогда не тренируясь на каких-либо 3D-данных.

2 минуты чтенияПоследнее обновление

Обзор

Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.

Глубокое погружение

DreamFusion из Google в 2022 году задал вопрос: может ли 2D-модель преобразования текста в изображение научить 3D-сцену выглядеть правильно со всех сторон? Он оптимизирует NeRF (Neural Radiance Field) так, что визуализация со случайных точек зрения камеры, зашумленная и показанная модели замороженной диффузии (Imagen), оценивается как правдоподобные изображения для текстовой подсказки. Важно отметить, что он не использует данные 3D-обучения. Прорывом является Score Distillation Sampling (SDS): вместо обратного распространения сигнала через дорогостоящую U-сеть диффузионной модели SDS использует прогнозируемый шум модели в качестве градиентного сигнала непосредственно на визуализируемых пикселях. Итерация этого процесса с тысячами точек обзора позволяет создать целостный 3D-ресурс с геометрией и внешним видом, зависящим от вида, из одного предложения.

Техническая информация

SDS рассматривает модель диффузии как замороженную скоринговую функцию. Он визуализирует NeRF, добавляет шум, просит диффузионную U-Net спрогнозировать этот шум и вычисляет градиент как (прогнозируемый шум минус добавленный шум), возвращаемый обратно на визуализированное изображение и, таким образом, взвешивает NeRF. Пропуск якобиана U-Net делает его управляемым. Для получения точных результатов необходимо высокое руководство без классификатора (около 100), что приводит к характерному перенасыщенному, иногда размытому виду «DreamFusion».

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее DreamFusion и Score Distillation Sampling

SDS породила богатую работу по исправлению своих недостатков: Magic3D для разрешения и скорости, Variational Score Distillation от ProlificDreamer для более четких и разнообразных результатов, а также методы атаки на многоликий артефакт «Янус». В этой области SDS все чаще сочетается с многопроекционными диффузионными априорами и быстрыми трехмерными представлениями, такими как Gaussian Splatting. Ожидайте, что преобразование текста в 3D будет расти быстрее и геометрически точнее, сокращая разрыв за счет ресурсов, смоделированных вручную.

Реальная реализация

Создание 3D-модели «DSLR-фотографии белки в крошечной шляпе» только из текста

Создание проектов игры и AR-ресурсов без ручного 3D-лепки

Создание экспортируемых сеток, которые художники улучшают, а не создают с нуля.

Базовые направления исследований для оценки новых методов преобразования текста в 3D на предмет соответствия SDS

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DreamFusion and Score Distillation Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Генеративные модели на основе оценок

Часто задаваемые вопросы

What is DreamFusion and Score Distillation Sampling?

DreamFusion генерирует 3D-объекты из текста, используя в качестве критика модель диффузии 2D-изображений, никогда не тренируясь на каких-либо 3D-данных. Ее основное изобретение, Score Distillation Sampling, стало основополагающим рецептом для всей области преобразования текста в 3D.

Какое трехмерное представление оптимизирует DreamFusion?

DreamFusion оптимизирует NeRF таким образом, чтобы его визуализированные представления соответствовали оценке текстовой подсказки 2D-модели диффузии.

Какой объем 3D-данных для обучения требуется DreamFusion?

DreamFusion использует замороженную 2D-модель диффузии текста в изображение в качестве единственного средства управления, не требующего 3D-данных для обучения.

Каков ключевой упрощенный метод расчета при отборе проб с помощью дистилляционной оценки?

SDS использует прогнозируемый минус добавленный шум в качестве прямого градиента на визуализируемых пикселях, избегая дорогостоящего якобиана U-Net.

Почему DreamFusion использует очень высокое руководство без классификаторов (~ 100)?

Градиент SDS шумный и слабый, поэтому для четкой и оперативной геометрии требуется необычно высокое наведение, хотя это приводит к перенасыщению.

Какая 2D-модель использовалась в оригинальной DreamFusion в качестве замороженной предыдущей версии?

DreamFusion был построен на основе модели диффузии текста в изображение Imagen Google в качестве функции замороженной оценки.