Оценка на дълбочината на дифузия на невен
Marigold пренасочва предварително обучен дифузионен модел за генериране на изображения (Stable Diffusion), за да предскаже много детайлни карти на дълбочината.
Преглед
It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.
Дълбоко гмуркане
Marigold (ETH Zurich, CVPR 2024 Best Paper Honorable Mention) преформулира оценката на дълбочината като условен проблем за генериране. Вместо да обучава дълбочинна мрежа от нулата, той фино настройва Stable Diffusion, за да „генерира“ карта на дълбочината, обусловена от входно изображение. Прозрението е, че модел, обучен да синтезира фотореалистични изображения, вече е научил геометрията на сцената, осветлението и структурата дълбоко в своето латентно пространство, точно предишните неща, полезни за дълбочината. Забележително е, че Marigold беше фино настроен само върху синтетични набори от данни (като Hypersim и Virtual KITTI), но въпреки това се обобщава добре за реални снимки с нулева снимка. Той произвежда афинно-инвариантна относителна дълбочина с изключително фини детайли, въпреки че итеративното премахване на шума го прави по-бавен от моделите с подаване напред като DepthAnything.
Техническа информация
Marigold работи в латентното пространство на Stable Diffusion. И изображението, и картата на дълбочината са кодирани от един и същ VAE; U-Net е фино настроен, за да обезшуми латентна дълбочина, обусловена от латентното чисто изображение. При извода той изпълнява стандартния итеративен цикъл за премахване на шума, след което декодира латентната дълбочина. Тъй като взема проби, множество изпълнения могат да бъдат групирани за стабилност, търгувайки изчисления за точност. По-късните 'LCM' и едностъпковите дестилирани версии намаляват десетките стъпки до едно минаване.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на оценката на дълбочината на дифузия на невен
Рецептата на Marigold, която фино настройва дифузионните априори за плътно предсказване, обобщава отвъд дълбочината до нормалите на повърхността, присъщото разлагане на изображението и оценката на материала. По-бързо дестилирани варианти и варианти на модели за консистенция затварят разликата в скоростта с мрежи за подаване напред, което прави базираното на дифузия възприятие жизнеспособно в интерактивните инструменти. Очаквайте по-широка тенденция, при която един предварително обучен генеративен гръбнак е адаптиран към много задачи за геометрия и възприятие, намалявайки необходимостта от големи набори от данни, специфични за задачата.
Внедряване в реалния свят
Извличане на фина дълбочина от архитектурни и продуктови снимки за повторно осветяване и 3D макети.
Генериране на карти с дълбочина с висока детайлност, използвани като кондициониране за генериране на управляемо изображение и видео.
Подпомагане на филмови и VFX екипи при работа с мат и паралакс, където прецизността на ръбовете има значение.
Служи като базова линия за изследване, показваща как да се адаптират генеративни преди към задачи за плътно прогнозиране.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Marigold Diffusion Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Монокулярна оценка на дълбочината
Frequently asked questions
What is Marigold Diffusion Depth Estimation?
Marigold пренасочва предварително обучен дифузионен модел за генериране на изображения (Stable Diffusion), за да предскаже много детайлни карти на дълбочината. Той показва, че можете да превърнете богатите визуални познания на генератора в прецизен инструмент за възприемане с изненадващо малко данни за обучение.
На какъв предварително обучен модел надгражда Marigold?
Marigold прецизира модела на латентна дифузия Stable Diffusion, за да създаде карти на дълбочината.
Как Marigold формулира задачата за оценка на дълбочината?
Той третира дълбочината като нещо, което трябва да бъде „генерирано“ в зависимост от входното изображение, използвайки повторно дифузионни машини.
Какво беше изненадващо в данните за обучението на Marigold?
Marigold беше фино настроен на базата на синтетични данни като Hypersim и Virtual KITTI, но обобщава нулевата снимка към реални снимки.
Защо Marigold обикновено е по-бавен от моделите за дълбочина с подаване напред?
Дифузионните модели премахват шума през множество стъпки, правейки извода по-бавен от едно преминаване напред.
В какво пространство невенът извършва процеса на дифузия?
Както изображението, така и дълбочината са кодирани в латентното пространство на VAE, където U-Net обезшумява.