PRZEWODNIK Wizualnej AI

Szacowanie głębokości jednoocznej

Jednooczna szacowana głębia przewiduje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia — nie jest wymagana kamera stereo, lidar ani czujnik głębokości.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It lets one camera perceive 3D structure from a flat 2D image.

Głębokie nurkowanie

Ludzie potrafią ocenić głębokość jednym okiem na podstawie takich czynników, jak perspektywa, względny rozmiar, gradienty tekstury, cieniowanie i okluzja. Jednooczna ocena głębi uczy sieci neuronowe tej samej sztuczki: dostarcza pojedynczy obraz RGB i podaje wartość głębi dla każdego piksela. Ponieważ obraz 2D jest z natury niejednoznaczny co do skali bezwzględnej, zadanie jest trudne — wiele scen 3D może być wyświetlanych na tym samym obrazie. Aby rozwiązać ten problem, sieci uczą się priorytetów statystycznych z dużych zbiorów danych. Trening występuje w dwóch wersjach: nadzorowany, wykorzystujący głębokość rzeczywistą z gruntu z czujników lidarowych lub RGB-D, oraz samonadzorowany, który uczy się głębi wyłącznie z par wideo lub stereo, wymuszając, aby przewidywana głębokość prawidłowo rzutowała jeden widok na drugi. Najnowsze podstawowe modele, takie jak MiDaS i Depth Everything, w niezwykły sposób uogólniają niewidziane sceny.

Wgląd techniczny

Metody samonadzorowane wykorzystują geometrię zamiast etykiet. Biorąc pod uwagę dwa widoki (stereo lub kolejne klatki wideo) i przewidywaną mapę głębi oraz ruch kamery, model wypacza jeden obraz, aby zrekonstruować drugi; błąd rekonstrukcji na poziomie pikseli staje się sygnałem uczącym. Ta utrata „syntezy widoku” oznacza, że ​​głębi można się nauczyć z surowego, nieoznakowanego wideo. Kluczowym ograniczeniem jest niejednoznaczność skali: głębokość jednooczna jest często prawidłowa tylko do nieznanego mnożnika, chyba że skalibrowano ją w oparciu o znane odniesienia lub nadzór metryczny.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość szacowania głębokości jednoocznej

Ogólne modele fundamentów głębi wyszkolone na milionach mieszanych obrazów zmierzają w stronę niezawodnej, metrycznej (w prawdziwej skali) głębi w każdej scenie, nawet tej, której nigdy nie widziano podczas treningu. Spodziewaj się ściślejszej fuzji z przepływem optycznym i SLAM w celu pełnej rekonstrukcji sceny 3D, lżejszych modeli, które działają na żywo na telefonach i zestawach słuchawkowych, oraz większej odporności na zerowy strzał. Dzięki temu bogata percepcja przestrzenna będzie tania i wszechobecna i będzie dostępna za pomocą dowolnej pojedynczej kamery, a nie drogich platform do wykrywania głębi.

Implementacja w świecie rzeczywistym

Tryb portretowy smartfona symulujący rozmycie tła (bokeh) poprzez oszacowanie odległości między obiektem a tłem

Aplikacje wykorzystujące rzeczywistość rozszerzoną umieszczają wirtualne obiekty tak, aby prawidłowo znajdowały się za meblami z prawdziwego świata

Drony i niedrogie roboty omijające przeszkody za pomocą jednej kamery skierowanej do przodu

Konwertowanie zdjęć i filmów 2D na 3D poprzez określanie głębi na piksel na potrzeby wyświetlania stereoskopowego

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Monocular Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szacowanie głębokości stereo

Często zadawane pytania

What is Monocular Depth Estimation?

Jednooczna szacowana głębia przewiduje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia — nie jest wymagana kamera stereo, lidar ani czujnik głębokości. Pozwala jednej kamerze dostrzec strukturę 3D na podstawie płaskiego obrazu 2D.

Co sprawia, że ​​szacowanie głębokości jest „jednooczne”?

„Jednooczny” oznacza jedno oko/aparat; metoda przewiduje głębokość na podstawie pojedynczego obrazu RGB bez stereo lub aktywnych czujników głębokości.

Dlaczego ocena głębokości jednoocznej jest zasadniczo niejednoznaczna?

Pojedyncza projekcja 2D traci informacje o skali, więc wiele aranżacji 3D jest spójnych z jednym obrazem; sieci opierają się na wyuczonych doświadczeniach, aby ujednoznacznić.

W jaki sposób metody samonadzoru uczą się głębi bez etykiet opartych na faktach?

Wykorzystując przewidywaną głębokość i ruch kamery, model ponownie rzutuje jeden obraz na drugi; błąd fotometryczny dostarcza sygnał uczenia się, nie są potrzebne żadne etykiety.

Na jakiej wskazówce sieci jednooczne NIE opierają się bezpośrednio na głębi?

Rozbieżność stereo wymaga dwóch kamer; metody jednooczne opierają się na wskazówkach pojedynczego obrazu, takich jak rozmiar, perspektywa, tekstura i okluzja.

Czym jest „niejednoznaczność skali” w głębi jednoocznej?

Bez nadzoru metrycznego lub znanego odniesienia głębokość jednooczna daje prawidłową strukturę względną, ale niepewną skalę bezwzględną.