PRZEWODNIK Wizualnej AI

Szacowanie głębokości stereo

Oszacowanie głębi stereo pozwala określić, jak daleko znajdują się rzeczy, porównując dwa lekko przesunięte widoki z kamery, tak jak robi to dwoje oczu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It turns flat images into 3D distance maps that robots, cars, and phones rely on to understand space.

Głębokie nurkowanie

Do szacowania głębi stereo wykorzystuje się dwie kamery umieszczone w stałej odległości od siebie (linia bazowa). Ten sam punkt na świecie znajduje się w nieco innych pozycjach poziomych na lewym i prawym obrazie, a to przesunięcie nazywa się rozbieżnością. Pobliskie obiekty bardzo się przesuwają; odległe ledwo się poruszają. Głębokość oblicza się jako (ogniskowa x linia bazowa)/rozbieżność, więc głębokość i rozbieżność są odwrotnie powiązane. Najtrudniejszą częścią jest dopasowanie pikseli między dwoma obrazami, szczególnie na gładkich ścianach, powtarzających się wzorach lub powierzchniach odblaskowych, gdzie wiele pikseli wygląda identycznie. Klasyczne metody, takie jak Semi-Global Matching, skanują wzdłuż linii skanowania, podczas gdy nowoczesne głębokie sieci, takie jak PSMNet i RAFT-Stereo, uczą się bogatych funkcji i iteracyjnie poprawiają rozbieżności, tworząc gęstą, dokładną głębię nawet w trudnych regionach.

Wgląd techniczny

Obydwa obrazy są najpierw korygowane, tak aby pasujące punkty znajdowały się w tym samym poziomym rzędzie, co ogranicza wyszukiwanie do jednego wymiaru. Wielkość kosztów tworzona jest poprzez testowanie rozbieżności każdego kandydata dla każdego piksela i mierzenie zgodności cech lewej i prawej. Sieci agregują tę objętość za pomocą splotów 3D lub okresowych aktualizacji, a następnie podejmują miękki argument dotyczący rozbieżności, aby uzyskać precyzję subpikselową. Odwrotna zależność między rozbieżnością a głębokością oznacza, że ​​dalsza głębokość jest z natury głośniejsza niż bliższa głębokość.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość szacowania głębi stereo

Spodziewaj się ściślejszej fuzji stereo z LiDAR, radarem i sygnałami jednoocznymi, dzięki czemu systemy płynnie ulegają degradacji w przypadku awarii jednego czujnika. Dopasowywanie oparte na transformatorach i samonadzorowane szkolenie (uczenie się na podstawie surowego wideo bez wnikliwej wiedzy) zmniejszają zapotrzebowanie na drogie, oznakowane dane. Wydajność urządzeń szybko się poprawia, zapewniając dźwięk stereo w czasie rzeczywistym w dronach, okularach AR i tanich robotach. Kamery eventowe i wyuczone aktywne wzorce zapewniają niezawodną głębię nawet przy słabym oświetleniu, rozmyciu ruchu i scenach pozbawionych tekstur, które pokonują dzisiejsze metody.

Implementacja w świecie rzeczywistym

Systemy autonomiczne i systemy wspomagania kierowcy wykorzystują kamery stereoskopowe do pomiaru odległości od samochodów, pieszych i krawężników w celu hamowania i utrzymywania pasa ruchu.

Roboty magazynowe i rolnicze tworzą mapy 3D, aby chwytać obiekty, omijać przeszkody i zbierać owoce na odpowiedniej głębokości.

Zestawy słuchawkowe AR/VR, takie jak urządzenia przejściowe, szacują geometrię pomieszczenia, dzięki czemu wirtualne obiekty prawidłowo układają się na rzeczywistych powierzchniach.

Łaziki marsjańskie (np. Perseverance) wykorzystują stereofoniczne kamery nawigacyjne do planowania bezpiecznych ścieżek po skalistym terenie bez GPS.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stereo Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Oszacowanie głębokości dyfuzji nagietka

Często zadawane pytania

What is Stereo Depth Estimation?

Oszacowanie głębi stereo pozwala określić, jak daleko znajdują się rzeczy, porównując dwa lekko przesunięte widoki z kamery, tak jak robi to dwoje oczu. Zamienia płaskie obrazy w trójwymiarowe mapy odległości, na których korzystają roboty, samochody i telefony, aby zrozumieć przestrzeń.

Czym jest „rozbieżność” w widzeniu stereoskopowym?

Rozbieżność oznacza, jak daleko odpowiedni punkt przesuwa się w poziomie między dwoma skorygowanymi widokami; większa rozbieżność oznacza, że ​​obiekt jest bliżej.

Jak głębokość wiąże się z różnicą?

Głębokość = (ogniskowa x linia bazowa) / rozbieżność, więc gdy rozbieżność maleje, szacowana głębokość rośnie. Odległe obiekty mają niewielką rozbieżność.

Dlaczego obrazy są „poprawiane” przed dopasowaniem?

Prostowanie zniekształca oba obrazy, tak że dopasowania ograniczają się do jednej poziomej linii, zamieniając wyszukiwanie 2D w szybkie wyszukiwanie 1D.

Który scenariusz jest najtrudniejszy w przypadku dopasowania stereo?

Powierzchnie pozbawione tekstury lub powtarzające się sprawiają, że wiele pikseli wygląda identycznie, więc algorytm nie może z całą pewnością znaleźć odpowiedniego dopasowania.

Do czego odnosi się „punkt bazowy”?

Linią bazową jest separacja między dwoma środkami kamer; szersza linia bazowa poprawia dokładność w przypadku odległych obiektów.