Oszacowanie głębokości dyfuzji nagietka
Marigold wykorzystuje wstępnie wytrenowany model dyfuzji generowania obrazu (Stable Diffusion), aby przewidywać bardzo szczegółowe mapy głębi.
Przegląd
It shows you can turn a generator's rich visual knowledge into a precise perception tool with surprisingly little training data.
Głębokie nurkowanie
Marigold (ETH Zurich, wyróżnienie CVPR 2024 za najlepszą publikację) ponownie przedstawia szacowanie głębokości jako problem generacji warunkowej. Zamiast trenować sieć głębi od zera, dostraja Stable Diffusion, aby „generować” mapę głębi uwarunkowaną obrazem wejściowym. Wnioski są takie, że model wytrenowany w syntezie fotorealistycznych obrazów nauczył się już geometrii sceny, oświetlenia i struktury głęboko w swojej ukrytej przestrzeni, czyli dokładnie tego, co jest przydatne w przypadku głębi. Co ciekawe, Marigold został dostrojony wyłącznie na syntetycznych zbiorach danych (takich jak Hypersim i Virtual KITTI), a mimo to dobrze generalizuje na rzeczywistych zdjęciach w trybie zerowym. Generuje niezmienną afiniczną głębię względną z wyjątkowo drobnymi szczegółami, chociaż iteracyjne odszumianie sprawia, że jest wolniejsza niż modele ze sprzężeniem do przodu, takie jak DepthAnything.
Wgląd techniczny
Marigold działa w ukrytej przestrzeni Stable Diffusion. Zarówno obraz, jak i mapa głębi są kodowane przez ten sam VAE; Sieć U-Net jest dostrojona tak, aby odszumiać utajoną głębię uwarunkowaną czystym utajonym obrazem. Podczas wnioskowania uruchamia standardową iteracyjną pętlę odszumiania, a następnie dekoduje ukrytą głębokość. Ponieważ próbkuje, można połączyć wiele przebiegów w celu zapewnienia stabilności, zamieniając obliczenia na dokładność. Późniejsze wersje „LCM” i jednoetapowa destylacja ograniczają dziesiątki stopni do jednego przejścia.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość szacowania głębokości dyfuzji nagietka
Przepis na Marigold, dostrajający priorytety dyfuzji w celu przewidywania gęstości, uogólnia poza normalne głębokości na powierzchnie, wewnętrzny rozkład obrazu i szacowanie materiału. Szybsze warianty modelu destylowanego i modelu konsystencji zmniejszają różnicę w szybkości dzięki sieciom ze sprzężeniem zwrotnym, dzięki czemu percepcja oparta na dyfuzji staje się realna w narzędziach interaktywnych. Należy spodziewać się szerszego trendu, w którym jeden wstępnie wyszkolony szkielet generatywny będzie dostosowany do wielu zadań związanych z geometrią i percepcją, co zmniejszy potrzebę stosowania dużych, oznaczonych etykietami zbiorów danych.
Implementacja w świecie rzeczywistym
Wydobywanie szczegółowej głębi ze zdjęć architektonicznych i produktów w celu ponownego oświetlenia i makiet 3D.
Generowanie szczegółowych map głębi wykorzystywanych jako kondycjonowanie w celu kontrolowanego generowania obrazów i wideo.
Pomaganie zespołom zajmującym się filmami i efektami wizualnymi w pracy z matą i paralaksą, gdzie liczy się precyzja krawędzi.
Służy jako punkt odniesienia do badań pokazujący, jak dostosować priorytety generatywne do gęstych zadań predykcyjnych.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Marigold Diffusion Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Szacowanie głębokości jednoocznej
Często zadawane pytania
What is Marigold Diffusion Depth Estimation?
Marigold wykorzystuje wstępnie wytrenowany model dyfuzji generowania obrazu (Stable Diffusion), aby przewidywać bardzo szczegółowe mapy głębi. Pokazuje, że przy użyciu zaskakująco małej ilości danych treningowych można przekształcić bogatą wiedzę wizualną generatora w precyzyjne narzędzie percepcji.
Na jakim wstępnie wytrenowanym modelu opiera się Marigold?
Marigold udoskonala model dyfuzji utajonej Stable Diffusion, aby utworzyć mapy głębokości.
Jak Marigold formułuje zadanie oszacowania głębokości?
Traktuje głębię jako coś, co należy „wygenerować” i uzależnić od obrazu wejściowego, ponownie wykorzystując maszynerię dyfuzyjną.
Co było zaskakujące w danych treningowych Marigold?
Marigold został dostrojony na danych syntetycznych, takich jak Hypersim i Virtual KITTI, ale uogólnia zdjęcia zerowe na prawdziwe zdjęcia.
Dlaczego Marigold jest zazwyczaj wolniejszy niż modele głębokości ze sprzężeniem do przodu?
Modele dyfuzyjne odszumiają w wielu krokach, powodując, że wnioskowanie jest wolniejsze niż pojedyncze przejście do przodu.
W jakiej przestrzeni nagietek dokonuje procesu dyfuzji?
Zarówno obraz, jak i głębia są kodowane w utajonej przestrzeni VAE, w której U-Net odszumia.