Głębokość Dowolna głębokość jednooczna
DepthAnything to podstawowy model, który szacuje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia, bez specjalnego sprzętu.
Przegląd
It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.
Głębokie nurkowanie
DepthAnything (2024, wydany przez badaczy, w tym z TikTok/ByteDance i HKU) dotyczy szacowania głębokości jednoocznej: przewidywania mapy głębi na podstawie jednego obrazu RGB. Przełomem była skala: zamiast polegać wyłącznie na ograniczonych dostępnych danych dotyczących głębokości oznaczonych etykietami, zespół zbudował silnik, który automatycznie opisał około 62 milionów nieopisanych zdjęć przy użyciu modelu nauczyciela, a następnie przeszkolił ucznia w zakresie tego ogromnego korpusu. Daje to silne uogólnienie typu zero-shot w przypadku scen w pomieszczeniach, na zewnątrz i nietypowych. Oryginał podaje względną głębokość (które piksele są bliżej lub dalej, a nie dokładne metry). W programie DepthAnything w wersji 2 (połowa 2024 r.) wyostrzono drobne szczegóły, szkoląc nauczyciela na danych syntetycznych z doskonałą prawdą podstawową, a następnie przekształcając je w rzeczywiste obrazy, naprawiając rozmyte krawędzie i błędy przezroczystych obiektów.
Wgląd techniczny
Wykorzystuje koder z transformatorem wizyjnym DINOv2 zasilający gęstą głowicę predykcyjną typu DPT. Kluczową sztuczką jest destylacja częściowo nadzorowana: nauczyciel przeszkolony w zakresie oznaczonych danych pseudooznacza miliony nieoznaczonych obrazów, a uczeń uczy się na obu. V2 zamienia zaszumione rzeczywiste etykiety na dane syntetyczne z idealną głębią w pikselach, a następnie powraca do prawdziwych zdjęć, omijając niedostatek i szum adnotacji o rzeczywistej głębi, zachowując jednocześnie wyraźne granice.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość głębi Jakakolwiek głębokość jednooczna
Można się spodziewać ściślejszej integracji z okularami AR, aparatami w smartfonach i robotyką tam, gdzie dedykowany LiDAR jest zbyt kosztowny lub nieporęczny. Warianty metryczne, które wyświetlają prawdziwe liczniki, a także modele wideo o tymczasowo stabilnej głębokości (bez migotania między klatkami) szybko się rozwijają. Ponieważ modele te zawężają się do działania na urządzeniu w czasie rzeczywistym, postrzeganie 3D za pomocą jednej kamery stanie się funkcją domyślną, obsługującą obliczenia przestrzenne, autonomiczną nawigację i generatywną rekonstrukcję scen 3D.
Implementacja w świecie rzeczywistym
Generowanie map głębi w celu uzyskania realistycznego rozmycia tła (bokeh) na zdjęciach portretowych wykonanych smartfonem z jednym obiektywem.
Zapewnia trójwymiarową percepcję przeszkód dla tanich dronów i robotów, którym brakuje kamer LiDAR lub stereo.
Tworzenie map warunkowania głębi dla ControlNet, aby generatory obrazów zachowały geometrię sceny.
Konwersja zdjęć i filmów 2D na efekty 3D lub paralaksy dla VR i wyświetlaczy stereoskopowych.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DepthAnything Monocular Depth quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Szacowanie głębokości jednoocznej
Często zadawane pytania
What is DepthAnything Monocular Depth?
DepthAnything to podstawowy model, który szacuje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia, bez specjalnego sprzętu. Dzięki niemu solidne, uniwersalne czujniki głębokości są tanie i dostępne dla każdego urządzenia, od telefonów po roboty.
Co oznacza „jednooczna” ocena głębokości?
Monokular oznacza, że głębokość jest określana na podstawie obrazu z jednej (mono) kamery, bez pary stereo lub aktywnego czujnika.
Jaka była główna strategia DepthAnything mająca na celu osiągnięcie silnej generalizacji?
Zespół zbudował silnik danych, który pseudo-oznaczał dziesiątki milionów nieoznaczonych zdjęć, radykalnie zwiększając skalę szkolenia.
Na jakim koderze szkieletowym opiera się DepthAnything?
DepthAnything wykorzystuje koder DINOv2 ViT w połączeniu z gęstą głowicą predykcyjną typu DPT.
Jaką głębię generuje przede wszystkim oryginalna DepthAnything?
Model podstawowy przewiduje względne uporządkowanie głębokości, a nie bezwzględne odległości metryczne.
W jaki sposób DepthAnything V2 poprawił drobne szczegóły i krawędzie?
V2 przeszkolił nauczyciela na syntetycznych obrazach o dokładnej głębi, a następnie destylował je do prawdziwych zdjęć w celu uzyskania ostrzejszych granic.