РЪКОВОДСТВО за визуален AI

Оценка на дълбочината на дифузия на невен

Marigold пренасочва предварително обучен дифузионен модел за генериране на изображения (Stable Diffusion), за да предскаже много детайлни карти на дълбочината.

2 min readПоследна актуализация

Преглед

It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.

Дълбоко гмуркане

Marigold (ETH Zurich, CVPR 2024 Best Paper Honorable Mention) преформулира оценката на дълбочината като условен проблем за генериране. Вместо да обучава дълбочинна мрежа от нулата, той фино настройва Stable Diffusion, за да „генерира“ карта на дълбочината, обусловена от входно изображение. Прозрението е, че модел, обучен да синтезира фотореалистични изображения, вече е научил геометрията на сцената, осветлението и структурата дълбоко в своето латентно пространство, точно предишните неща, полезни за дълбочината. Забележително е, че Marigold беше фино настроен само върху синтетични набори от данни (като Hypersim и Virtual KITTI), но въпреки това се обобщава добре за реални снимки с нулева снимка. Той произвежда афинно-инвариантна относителна дълбочина с изключително фини детайли, въпреки че итеративното премахване на шума го прави по-бавен от моделите с подаване напред като DepthAnything.

Техническа информация

Marigold работи в латентното пространство на Stable Diffusion. И изображението, и картата на дълбочината са кодирани от един и същ VAE; U-Net е фино настроен, за да обезшуми латентна дълбочина, обусловена от латентното чисто изображение. При извода той изпълнява стандартния итеративен цикъл за премахване на шума, след което декодира латентната дълбочина. Тъй като взема проби, множество изпълнения могат да бъдат групирани за стабилност, търгувайки изчисления за точност. По-късните 'LCM' и едностъпковите дестилирани версии намаляват десетките стъпки до едно минаване.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на оценката на дълбочината на дифузия на невен

Рецептата на Marigold, която фино настройва дифузионните априори за плътно предсказване, обобщава отвъд дълбочината до нормалите на повърхността, присъщото разлагане на изображението и оценката на материала. По-бързо дестилирани варианти и варианти на модели за консистенция затварят разликата в скоростта с мрежи за подаване напред, което прави базираното на дифузия възприятие жизнеспособно в интерактивните инструменти. Очаквайте по-широка тенденция, при която един предварително обучен генеративен гръбнак е адаптиран към много задачи за геометрия и възприятие, намалявайки необходимостта от големи набори от данни, специфични за задачата.

Внедряване в реалния свят

Извличане на фина дълбочина от архитектурни и продуктови снимки за повторно осветяване и 3D макети.

Генериране на карти с дълбочина с висока детайлност, използвани като кондициониране за генериране на управляемо изображение и видео.

Подпомагане на филмови и VFX екипи при работа с мат и паралакс, където прецизността на ръбовете има значение.

Служи като базова линия за изследване, показваща как да се адаптират генеративни преди към задачи за плътно прогнозиране.

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Монокулярна оценка на дълбочината

Frequently asked questions

What is Marigold Diffusion Depth Estimation?

Marigold пренасочва предварително обучен дифузионен модел за генериране на изображения (Stable Diffusion), за да предскаже много детайлни карти на дълбочината. Той показва, че можете да превърнете богатите визуални познания на генератора в прецизен инструмент за възприемане с изненадващо малко данни за обучение.

На какъв предварително обучен модел надгражда Marigold?

Marigold прецизира модела на латентна дифузия Stable Diffusion, за да създаде карти на дълбочината.

Как Marigold формулира задачата за оценка на дълбочината?

Той третира дълбочината като нещо, което трябва да бъде „генерирано“ в зависимост от входното изображение, използвайки повторно дифузионни машини.

Какво беше изненадващо в данните за обучението на Marigold?

Marigold беше фино настроен на базата на синтетични данни като Hypersim и Virtual KITTI, но обобщава нулевата снимка към реални снимки.

Защо Marigold обикновено е по-бавен от моделите за дълбочина с подаване напред?

Дифузионните модели премахват шума през множество стъпки, правейки извода по-бавен от едно преминаване напред.

В какво пространство невенът извършва процеса на дифузия?

Както изображението, така и дълбочината са кодирани в латентното пространство на VAE, където U-Net обезшумява.