Вземане на проби от DreamFusion и Score Destillation
DreamFusion генерира 3D обекти от текст, като използва модел на дифузия на 2D изображение като критик, без да тренира върху 3D данни.
Преглед
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
Дълбоко гмуркане
DreamFusion, от Google през 2022 г., попита: може ли 2D модел текст към изображение да научи 3D сцена да изглежда правилно от всеки ъгъл? Той оптимизира NeRF (Neural Radiance Field), така че изобразяванията от произволни гледни точки на камерата, когато са шумени и показани на модел на замразена дифузия (Imagen), се оценяват като правдоподобни изображения за текстовата подкана. Най-важното е, че не използва данни за 3D обучение. Пробивът е Score Distillation Sampling (SDS): вместо обратно разпространение през скъпата U-Net на дифузионния модел, SDS използва прогнозирания шум на модела като градиентен сигнал директно върху изобразените пиксели. Итерирането на това в хиляди гледни точки извайва последователен 3D актив, пълен с геометрия и зависим от изгледа вид, от едно изречение.
Техническа информация
SDS третира дифузионния модел като замразена точкова функция. Той изобразява NeRF, добавя шум, иска от дифузионната U-Net да предскаже този шум и изчислява градиента като (предсказан шум минус добавен шум) се избутва обратно върху изобразеното изображение и по този начин теглата на NeRF. Пропускането на U-Net Jacobian го прави податлив. Необходими са високи насоки без класификатор (около 100) за ясни резултати, което причинява характерния пренаситен, понякога замъглен „вид на DreamFusion“.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на DreamFusion и Score Destillation Sempling
SDS породи богат набор от дейности, коригирайки своите слабости: Magic3D за разделителна способност и скорост, ProlificDreamer's Variational Score Destillation за по-отчетливи, по-разнообразни резултати и методи за атакуване на многолицевия артефакт „Янус“. Областта все повече съчетава SDS с предшестваща дифузия с множество изгледи и бързи 3D представяния като Gaussian Splatting. Очаквайте преобразуването на текст към 3D да се развива по-бързо и по-вярно геометрично, намалявайки разликата с ръчно моделирани активи.
Внедряване в реалния свят
Генериране на 3D модел на „DSLR снимка на катерица, носеща малка шапка“ само от текст
Създаване на чернова на игра и AR активи без ръчно 3D скулптуриране
Произвеждане на експортируеми мрежи, които художниците прецизират, вместо да изграждат от нулата
Изследвайте базовите линии за оценка на по-нови методи за преобразуване на текст в 3D спрямо SDS
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Генеративни модели, базирани на резултати
Frequently asked questions
What is DreamFusion and Score Distillation Sampling?
DreamFusion генерира 3D обекти от текст, като използва модел на дифузия на 2D изображение като критик, без да тренира върху 3D данни. Неговото основно изобретение, Score Destillation Sampling, се превърна в основополагаща рецепта за цялото поле за преобразуване на текст в 3D.
Какво 3D представяне оптимизира DreamFusion?
DreamFusion оптимизира NeRF, така че изобразените му изгледи да задоволят преценката на 2D дифузионен модел за текстовата подкана.
Колко данни за 3D обучение изисква DreamFusion?
DreamFusion използва замразен 2D модел на дифузия на текст към изображение като единственото си наблюдение, което не изисква данни за 3D обучение.
Какъв е ключовият изчислителен пряк път при вземане на проби от Score Destillation?
SDS използва прогнозирания минус добавен шум като директен градиент върху изобразените пиксели, избягвайки скъпия U-Net Jacobian.
Защо DreamFusion използва много високи насоки без класификатор (~100)?
SDS градиентът е шумен и слаб, така че са необходими необичайно високи насоки за ясна геометрия при подкана, въпреки че причинява пренасищане.
Кой 2D модел използва оригиналният DreamFusion като своя замразена предишна?
DreamFusion е изграден върху модела за разпространение на текст към изображение Imagen на Google като функция за замразено оценяване.