Разпространение на нов изглед от нула 1 до 3
Zero-1-to-3 превръща една снимка на обект в изображения на същия обект, гледани от всеки нов ъгъл, използвайки модел на дифузия, обусловен от въртенето на камерата, което поискате.
Преглед
It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.
Дълбоко гмуркане
Zero-1-to-3 (от Columbia, 2023) фино настройва стабилната дифузия, така че да може да извършва синтез на нов изглед с нулева снимка от едно входно изображение. Подавате му една снимка плюс относителна трансформация на камерата (завъртане и малък превод) и моделът генерира как би изглеждал обектът от тази нова гледна точка. Ключовата идея е, че големите 2D дифузионни модели, обучени върху огромни уеб колекции от изображения, имплицитно са усвоили геометрични и физически предишни данни за това как обектите изглеждат в 3D. Чрез фина настройка на синтетичен набор от данни на обекти, изобразени от много контролирани ъгли на камерата (използвайки Objaverse), моделът се научава да картографира тези предишни данни върху изричен контрол на камерата. След това генерираните изгледи могат да подадат 3D реконструкция надолу по веригата.
Техническа информация
Условията на модела върху изходното изображение са по два начина: вграждане на CLIP е свързано с относителната поза на камерата (азимут, кота, радиус), за да се насочи кръстосаното внимание, докато необработеното изображение е канално свързано към латентния шум, така че фините детайли и идентичността са запазени. Обучението използва триплети изображение-поза-изображение, изобразени от CAD обекти, така че мрежата научава контролируемото картографиране между промяна на гледна точка и произтичащата промяна на пиксела.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на разпространението на нов изглед от нула 1 до 3
Zero-1-to-3 породи вълна от конвейери от изображение към 3D. Наследници като Zero123-XL, SyncDreamer и One-2-3-45 се стремят към съгласуваност с множество изгледи и по-бърз, по-надежден изход на 3D мрежа, докато интеграцията с Gaussian Splatting и големи модели за реконструкция свива времето за генериране от минути до секунди. Очаквайте по-строга последователност на изгледа, по-висока разделителна способност и генерализация на реалния свят (не само на синтетични обекти), тъй като тези дифузионни модели, контролирани от гледна точка, се превръщат в стандартни инструменти за създаване на съдържание.
Внедряване в реалния свят
Генериране на въртящи се изгледи на една снимка на продукт, така че списъкът на електронната търговия да може да показва артикула от всички страни
Стартиране на текстурирана 3D мрежа на обект от една случайна моментна снимка на телефон за визуализации на AR
Създаване на последователно многоъгълно референтно изкуство на персонаж или реквизит за концептуални художници на игри и филми
Подхранване на синтезирани нови изгледи в NeRF или Gaussian Splatting реконструкция за запълване на невидима геометрия
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Zero-1-to-3 Novel View Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Синтез на нов изглед
Frequently asked questions
What is Zero-1-to-3 Novel View Diffusion?
Zero-1-to-3 превръща една снимка на обект в изображения на същия обект, гледани от всеки нов ъгъл, използвайки модел на дифузия, обусловен от въртенето на камерата, което поискате. Има значение, защото ви позволява да реконструирате 3D-последователни изгледи, без изобщо да сканирате обекта от няколко страни.
Какъв е основният вход, от който се нуждае Zero-1-to-3 в допълнение към едно изображение, за да генерира нов изглед?
Нула 1 до 3 е обусловено от едно изображение плюс относителна поза на камерата, така че вие определяте завъртането и преместването към желаната гледна точка.
Нула 1 към 3 е изграден чрез фина настройка какъв вид модел?
Той фино настройва голям предварително обучен 2D дифузионен модел, така че да може да използва геометричните предишни модели, имплицитно научени от уеб изображения.
Защо 2D модел на дифузия изобщо може да извърши синтез на нов изглед с нулева снимка?
Мащабното 2D обучение дава имплицитно знание за това как обектите изглеждат в 3D, което фината настройка прави контролируемо чрез поза на камерата.
Какъв набор от данни от 3D обекти беше централен за обучението Zero-1-to-3?
Беше обучен на триплети изображение-поза-изображение, изобразени от големи колекции от синтетични 3D обекти като Objaverse.
Как се запазват фините детайли на изходното изображение при генерирането?
Необработеното изображение е канално свързано към латентния шум (заедно с вграждане на CLIP за семантика), така че идентичността и детайлите се предават.