PRZEWODNIK Wizualnej AI

Oszacowanie głębokości dyfuzji nagietka

Marigold wykorzystuje wstępnie wytrenowany model dyfuzji generowania obrazu (Stable Diffusion), aby przewidywać bardzo szczegółowe mapy głębi.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.

Głębokie nurkowanie

Marigold (ETH Zurich, wyróżnienie CVPR 2024 za najlepszą publikację) ponownie przedstawia szacowanie głębokości jako problem generacji warunkowej. Zamiast trenować sieć głębi od zera, dostraja Stable Diffusion, aby „generować” mapę głębi uwarunkowaną obrazem wejściowym. Wnioski są takie, że model wytrenowany w syntezie fotorealistycznych obrazów nauczył się już geometrii sceny, oświetlenia i struktury głęboko w swojej ukrytej przestrzeni, czyli dokładnie tego, co jest przydatne w przypadku głębi. Co ciekawe, Marigold został dostrojony wyłącznie na syntetycznych zbiorach danych (takich jak Hypersim i Virtual KITTI), a mimo to dobrze generalizuje na rzeczywistych zdjęciach w trybie zerowym. Generuje niezmienną afiniczną głębię względną z wyjątkowo drobnymi szczegółami, chociaż iteracyjne odszumianie sprawia, że ​​jest wolniejsza niż modele ze sprzężeniem do przodu, takie jak DepthAnything.

Wgląd techniczny

Marigold działa w ukrytej przestrzeni Stable Diffusion. Zarówno obraz, jak i mapa głębi są kodowane przez ten sam VAE; Sieć U-Net jest dostrojona tak, aby odszumiać utajoną głębię uwarunkowaną czystym utajonym obrazem. Podczas wnioskowania uruchamia standardową iteracyjną pętlę odszumiania, a następnie dekoduje ukrytą głębokość. Ponieważ próbkuje, można połączyć wiele przebiegów w celu zapewnienia stabilności, zamieniając obliczenia na dokładność. Późniejsze wersje „LCM” i jednoetapowa destylacja ograniczają dziesiątki stopni do jednego przejścia.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość szacowania głębokości dyfuzji nagietka

Przepis na Marigold, dostrajający priorytety dyfuzji w celu przewidywania gęstości, uogólnia poza normalne głębokości na powierzchnie, wewnętrzny rozkład obrazu i szacowanie materiału. Szybsze warianty modelu destylowanego i modelu konsystencji zmniejszają różnicę w szybkości dzięki sieciom ze sprzężeniem zwrotnym, dzięki czemu percepcja oparta na dyfuzji staje się realna w narzędziach interaktywnych. Należy spodziewać się szerszego trendu, w którym jeden wstępnie wyszkolony szkielet generatywny będzie dostosowany do wielu zadań związanych z geometrią i percepcją, co zmniejszy potrzebę stosowania dużych, oznaczonych etykietami zbiorów danych.

Implementacja w świecie rzeczywistym

Wydobywanie szczegółowej głębi ze zdjęć architektonicznych i produktów w celu ponownego oświetlenia i makiet 3D.

Generowanie szczegółowych map głębi wykorzystywanych jako kondycjonowanie w celu kontrolowanego generowania obrazów i wideo.

Pomaganie zespołom zajmującym się filmami i efektami wizualnymi w pracy z matą i paralaksą, gdzie liczy się precyzja krawędzi.

Służy jako punkt odniesienia do badań pokazujący, jak dostosować priorytety generatywne do gęstych zadań predykcyjnych.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Marigold Diffusion Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szacowanie głębokości jednoocznej

Często zadawane pytania

What is Marigold Diffusion Depth Estimation?

Marigold wykorzystuje wstępnie wytrenowany model dyfuzji generowania obrazu (Stable Diffusion), aby przewidywać bardzo szczegółowe mapy głębi. Pokazuje, że przy użyciu zaskakująco małej ilości danych treningowych można przekształcić bogatą wiedzę wizualną generatora w precyzyjne narzędzie percepcji.

Na jakim wstępnie wytrenowanym modelu opiera się Marigold?

Marigold udoskonala model dyfuzji utajonej Stable Diffusion, aby utworzyć mapy głębokości.

Jak Marigold formułuje zadanie oszacowania głębokości?

Traktuje głębię jako coś, co należy „wygenerować” i uzależnić od obrazu wejściowego, ponownie wykorzystując maszynerię dyfuzyjną.

Co było zaskakujące w danych treningowych Marigold?

Marigold został dostrojony na danych syntetycznych, takich jak Hypersim i Virtual KITTI, ale uogólnia zdjęcia zerowe na prawdziwe zdjęcia.

Dlaczego Marigold jest zazwyczaj wolniejszy niż modele głębokości ze sprzężeniem do przodu?

Modele dyfuzyjne odszumiają w wielu krokach, powodując, że wnioskowanie jest wolniejsze niż pojedyncze przejście do przodu.

W jakiej przestrzeni nagietek dokonuje procesu dyfuzji?

Zarówno obraz, jak i głębia są kodowane w utajonej przestrzeni VAE, w której U-Net odszumia.