PRZEWODNIK Wizualnej AI

Głębokość Dowolna głębokość jednooczna

DepthAnything to podstawowy model, który szacuje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia, bez specjalnego sprzętu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.

Głębokie nurkowanie

DepthAnything (2024, wydany przez badaczy, w tym z TikTok/ByteDance i HKU) dotyczy szacowania głębokości jednoocznej: przewidywania mapy głębi na podstawie jednego obrazu RGB. Przełomem była skala: zamiast polegać wyłącznie na ograniczonych dostępnych danych dotyczących głębokości oznaczonych etykietami, zespół zbudował silnik, który automatycznie opisał około 62 milionów nieopisanych zdjęć przy użyciu modelu nauczyciela, a następnie przeszkolił ucznia w zakresie tego ogromnego korpusu. Daje to silne uogólnienie typu zero-shot w przypadku scen w pomieszczeniach, na zewnątrz i nietypowych. Oryginał podaje względną głębokość (które piksele są bliżej lub dalej, a nie dokładne metry). W programie DepthAnything w wersji 2 (połowa 2024 r.) wyostrzono drobne szczegóły, szkoląc nauczyciela na danych syntetycznych z doskonałą prawdą podstawową, a następnie przekształcając je w rzeczywiste obrazy, naprawiając rozmyte krawędzie i błędy przezroczystych obiektów.

Wgląd techniczny

Wykorzystuje koder z transformatorem wizyjnym DINOv2 zasilający gęstą głowicę predykcyjną typu DPT. Kluczową sztuczką jest destylacja częściowo nadzorowana: nauczyciel przeszkolony w zakresie oznaczonych danych pseudooznacza miliony nieoznaczonych obrazów, a uczeń uczy się na obu. V2 zamienia zaszumione rzeczywiste etykiety na dane syntetyczne z idealną głębią w pikselach, a następnie powraca do prawdziwych zdjęć, omijając niedostatek i szum adnotacji o rzeczywistej głębi, zachowując jednocześnie wyraźne granice.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość głębi Jakakolwiek głębokość jednooczna

Można się spodziewać ściślejszej integracji z okularami AR, aparatami w smartfonach i robotyką tam, gdzie dedykowany LiDAR jest zbyt kosztowny lub nieporęczny. Warianty metryczne, które wyświetlają prawdziwe liczniki, a także modele wideo o tymczasowo stabilnej głębokości (bez migotania między klatkami) szybko się rozwijają. Ponieważ modele te zawężają się do działania na urządzeniu w czasie rzeczywistym, postrzeganie 3D za pomocą jednej kamery stanie się funkcją domyślną, obsługującą obliczenia przestrzenne, autonomiczną nawigację i generatywną rekonstrukcję scen 3D.

Implementacja w świecie rzeczywistym

Generowanie map głębi w celu uzyskania realistycznego rozmycia tła (bokeh) na zdjęciach portretowych wykonanych smartfonem z jednym obiektywem.

Zapewnia trójwymiarową percepcję przeszkód dla tanich dronów i robotów, którym brakuje kamer LiDAR lub stereo.

Tworzenie map warunkowania głębi dla ControlNet, aby generatory obrazów zachowały geometrię sceny.

Konwersja zdjęć i filmów 2D na efekty 3D lub paralaksy dla VR i wyświetlaczy stereoskopowych.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DepthAnything Monocular Depth quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szacowanie głębokości jednoocznej

Często zadawane pytania

What is DepthAnything Monocular Depth?

DepthAnything to podstawowy model, który szacuje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia, bez specjalnego sprzętu. Dzięki niemu solidne, uniwersalne czujniki głębokości są tanie i dostępne dla każdego urządzenia, od telefonów po roboty.

Co oznacza „jednooczna” ocena głębokości?

Monokular oznacza, że ​​głębokość jest określana na podstawie obrazu z jednej (mono) kamery, bez pary stereo lub aktywnego czujnika.

Jaka była główna strategia DepthAnything mająca na celu osiągnięcie silnej generalizacji?

Zespół zbudował silnik danych, który pseudo-oznaczał dziesiątki milionów nieoznaczonych zdjęć, radykalnie zwiększając skalę szkolenia.

Na jakim koderze szkieletowym opiera się DepthAnything?

DepthAnything wykorzystuje koder DINOv2 ViT w połączeniu z gęstą głowicą predykcyjną typu DPT.

Jaką głębię generuje przede wszystkim oryginalna DepthAnything?

Model podstawowy przewiduje względne uporządkowanie głębokości, a nie bezwzględne odległości metryczne.

W jaki sposób DepthAnything V2 poprawił drobne szczegóły i krawędzie?

V2 przeszkolił nauczyciela na syntetycznych obrazach o dokładnej głębi, a następnie destylował je do prawdziwych zdjęć w celu uzyskania ostrzejszych granic.