Szacowanie głębokości stereo
Oszacowanie głębi stereo pozwala określić, jak daleko znajdują się rzeczy, porównując dwa lekko przesunięte widoki z kamery, tak jak robi to dwoje oczu.
Przegląd
It turns flat images into 3D distance maps that robots, cars, and phones rely on to understand space.
Głębokie nurkowanie
Do szacowania głębi stereo wykorzystuje się dwie kamery umieszczone w stałej odległości od siebie (linia bazowa). Ten sam punkt na świecie znajduje się w nieco innych pozycjach poziomych na lewym i prawym obrazie, a to przesunięcie nazywa się rozbieżnością. Pobliskie obiekty bardzo się przesuwają; odległe ledwo się poruszają. Głębokość oblicza się jako (ogniskowa x linia bazowa)/rozbieżność, więc głębokość i rozbieżność są odwrotnie powiązane. Najtrudniejszą częścią jest dopasowanie pikseli między dwoma obrazami, szczególnie na gładkich ścianach, powtarzających się wzorach lub powierzchniach odblaskowych, gdzie wiele pikseli wygląda identycznie. Klasyczne metody, takie jak Semi-Global Matching, skanują wzdłuż linii skanowania, podczas gdy nowoczesne głębokie sieci, takie jak PSMNet i RAFT-Stereo, uczą się bogatych funkcji i iteracyjnie poprawiają rozbieżności, tworząc gęstą, dokładną głębię nawet w trudnych regionach.
Wgląd techniczny
Obydwa obrazy są najpierw korygowane, tak aby pasujące punkty znajdowały się w tym samym poziomym rzędzie, co ogranicza wyszukiwanie do jednego wymiaru. Wielkość kosztów tworzona jest poprzez testowanie rozbieżności każdego kandydata dla każdego piksela i mierzenie zgodności cech lewej i prawej. Sieci agregują tę objętość za pomocą splotów 3D lub okresowych aktualizacji, a następnie podejmują miękki argument dotyczący rozbieżności, aby uzyskać precyzję subpikselową. Odwrotna zależność między rozbieżnością a głębokością oznacza, że dalsza głębokość jest z natury głośniejsza niż bliższa głębokość.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość szacowania głębi stereo
Spodziewaj się ściślejszej fuzji stereo z LiDAR, radarem i sygnałami jednoocznymi, dzięki czemu systemy płynnie ulegają degradacji w przypadku awarii jednego czujnika. Dopasowywanie oparte na transformatorach i samonadzorowane szkolenie (uczenie się na podstawie surowego wideo bez wnikliwej wiedzy) zmniejszają zapotrzebowanie na drogie, oznakowane dane. Wydajność urządzeń szybko się poprawia, zapewniając dźwięk stereo w czasie rzeczywistym w dronach, okularach AR i tanich robotach. Kamery eventowe i wyuczone aktywne wzorce zapewniają niezawodną głębię nawet przy słabym oświetleniu, rozmyciu ruchu i scenach pozbawionych tekstur, które pokonują dzisiejsze metody.
Implementacja w świecie rzeczywistym
Systemy autonomiczne i systemy wspomagania kierowcy wykorzystują kamery stereoskopowe do pomiaru odległości od samochodów, pieszych i krawężników w celu hamowania i utrzymywania pasa ruchu.
Roboty magazynowe i rolnicze tworzą mapy 3D, aby chwytać obiekty, omijać przeszkody i zbierać owoce na odpowiedniej głębokości.
Zestawy słuchawkowe AR/VR, takie jak urządzenia przejściowe, szacują geometrię pomieszczenia, dzięki czemu wirtualne obiekty prawidłowo układają się na rzeczywistych powierzchniach.
Łaziki marsjańskie (np. Perseverance) wykorzystują stereofoniczne kamery nawigacyjne do planowania bezpiecznych ścieżek po skalistym terenie bez GPS.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stereo Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Oszacowanie głębokości dyfuzji nagietka
Często zadawane pytania
What is Stereo Depth Estimation?
Oszacowanie głębi stereo pozwala określić, jak daleko znajdują się rzeczy, porównując dwa lekko przesunięte widoki z kamery, tak jak robi to dwoje oczu. Zamienia płaskie obrazy w trójwymiarowe mapy odległości, na których korzystają roboty, samochody i telefony, aby zrozumieć przestrzeń.
Czym jest „rozbieżność” w widzeniu stereoskopowym?
Rozbieżność oznacza, jak daleko odpowiedni punkt przesuwa się w poziomie między dwoma skorygowanymi widokami; większa rozbieżność oznacza, że obiekt jest bliżej.
Jak głębokość wiąże się z różnicą?
Głębokość = (ogniskowa x linia bazowa) / rozbieżność, więc gdy rozbieżność maleje, szacowana głębokość rośnie. Odległe obiekty mają niewielką rozbieżność.
Dlaczego obrazy są „poprawiane” przed dopasowaniem?
Prostowanie zniekształca oba obrazy, tak że dopasowania ograniczają się do jednej poziomej linii, zamieniając wyszukiwanie 2D w szybkie wyszukiwanie 1D.
Który scenariusz jest najtrudniejszy w przypadku dopasowania stereo?
Powierzchnie pozbawione tekstury lub powtarzające się sprawiają, że wiele pikseli wygląda identycznie, więc algorytm nie może z całą pewnością znaleźć odpowiedniego dopasowania.
Do czego odnosi się „punkt bazowy”?
Linią bazową jest separacja między dwoma środkami kamer; szersza linia bazowa poprawia dokładność w przypadku odległych obiektów.