DreamFusion и Score дистилляционная выборка
DreamFusion генерирует 3D-объекты из текста, используя в качестве критика модель диффузии 2D-изображений, никогда не тренируясь на каких-либо 3D-данных.
Обзор
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
Глубокое погружение
DreamFusion из Google в 2022 году задал вопрос: может ли 2D-модель преобразования текста в изображение научить 3D-сцену выглядеть правильно со всех сторон? Он оптимизирует NeRF (Neural Radiance Field) так, что визуализация со случайных точек зрения камеры, зашумленная и показанная модели замороженной диффузии (Imagen), оценивается как правдоподобные изображения для текстовой подсказки. Важно отметить, что он не использует данные 3D-обучения. Прорывом является Score Distillation Sampling (SDS): вместо обратного распространения сигнала через дорогостоящую U-сеть диффузионной модели SDS использует прогнозируемый шум модели в качестве градиентного сигнала непосредственно на визуализируемых пикселях. Итерация этого процесса с тысячами точек обзора позволяет создать целостный 3D-ресурс с геометрией и внешним видом, зависящим от вида, из одного предложения.
Техническая информация
SDS рассматривает модель диффузии как замороженную скоринговую функцию. Он визуализирует NeRF, добавляет шум, просит диффузионную U-Net спрогнозировать этот шум и вычисляет градиент как (прогнозируемый шум минус добавленный шум), возвращаемый обратно на визуализированное изображение и, таким образом, взвешивает NeRF. Пропуск якобиана U-Net делает его управляемым. Для получения точных результатов необходимо высокое руководство без классификатора (около 100), что приводит к характерному перенасыщенному, иногда размытому виду «DreamFusion».
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее DreamFusion и Score Distillation Sampling
SDS породила богатую работу по исправлению своих недостатков: Magic3D для разрешения и скорости, Variational Score Distillation от ProlificDreamer для более четких и разнообразных результатов, а также методы атаки на многоликий артефакт «Янус». В этой области SDS все чаще сочетается с многопроекционными диффузионными априорами и быстрыми трехмерными представлениями, такими как Gaussian Splatting. Ожидайте, что преобразование текста в 3D будет расти быстрее и геометрически точнее, сокращая разрыв за счет ресурсов, смоделированных вручную.
Реальная реализация
Создание 3D-модели «DSLR-фотографии белки в крошечной шляпе» только из текста
Создание проектов игры и AR-ресурсов без ручного 3D-лепки
Создание экспортируемых сеток, которые художники улучшают, а не создают с нуля.
Базовые направления исследований для оценки новых методов преобразования текста в 3D на предмет соответствия SDS
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Генеративные модели на основе оценок
Часто задаваемые вопросы
What is DreamFusion and Score Distillation Sampling?
DreamFusion генерирует 3D-объекты из текста, используя в качестве критика модель диффузии 2D-изображений, никогда не тренируясь на каких-либо 3D-данных. Ее основное изобретение, Score Distillation Sampling, стало основополагающим рецептом для всей области преобразования текста в 3D.
Какое трехмерное представление оптимизирует DreamFusion?
DreamFusion оптимизирует NeRF таким образом, чтобы его визуализированные представления соответствовали оценке текстовой подсказки 2D-модели диффузии.
Какой объем 3D-данных для обучения требуется DreamFusion?
DreamFusion использует замороженную 2D-модель диффузии текста в изображение в качестве единственного средства управления, не требующего 3D-данных для обучения.
Каков ключевой упрощенный метод расчета при отборе проб с помощью дистилляционной оценки?
SDS использует прогнозируемый минус добавленный шум в качестве прямого градиента на визуализируемых пикселях, избегая дорогостоящего якобиана U-Net.
Почему DreamFusion использует очень высокое руководство без классификаторов (~ 100)?
Градиент SDS шумный и слабый, поэтому для четкой и оперативной геометрии требуется необычно высокое наведение, хотя это приводит к перенасыщению.
Какая 2D-модель использовалась в оригинальной DreamFusion в качестве замороженной предыдущей версии?
DreamFusion был построен на основе модели диффузии текста в изображение Imagen Google в качестве функции замороженной оценки.