Wizualny SLAM
Visual SLAM pozwala poruszającej się kamerze stworzyć mapę nieznanej przestrzeni, jednocześnie śledząc własną pozycję na tej mapie.
Przegląd
Jest przestrzennym kręgosłupem robotów, dronów, zestawów AR i funkcji autonomicznej jazdy.
Głębokie nurkowanie
SLAM oznacza jednoczesną lokalizację i mapowanie, a wariant wizualny rozwiązuje ten problem za pomocą kamer zamiast (lub obok) lidaru lub radaru. Gdy kamera się porusza, system wykrywa charakterystyczne cechy, takie jak narożniki i krawędzie, dopasowuje je do klatek i wykorzystuje pozorny ruch tych punktów do oszacowania zarówno struktury 3D sceny, jak i trajektorii kamery. Najtrudniejszą częścią jest połączenie kury z jajkiem: potrzebujesz mapy, aby wiedzieć, gdzie jesteś, ale musisz wiedzieć, gdzie jesteś, aby ją zbudować. Visual SLAM radzi sobie z tym wspólnie, często udoskonalając tysiące punktów i póz na raz. Obsługuje ARKit, ARCore, śledzenie od środka Meta Quest, łaziki marsjańskie i roboty magazynowe pracujące w pomieszczeniach zamkniętych, gdzie zawodzi GPS.
Wgląd techniczny
Typowy potok ma interfejs, który śledzi funkcje klatka po klatce (przy użyciu ORB, SIFT lub bezpośrednich metod fotometrycznych) oraz tył, który optymalizuje mapę. Regulacja wiązki wspólnie minimalizuje błąd ponownej projekcji w wielu pozycjach kamery i punktach 3D, a zamknięcie pętli wykrywa, kiedy kamera ponownie odwiedza dane miejsce i koryguje nagromadzony dryft. Monokularowy SLAM nie jest w stanie odzyskać skali absolutnej, dlatego kamery stereoskopowe lub inercyjna jednostka pomiarowa (IMU) są połączone, aby to naprawić.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość wizualnego SLAM
Pole przesuwa się od ręcznie tworzonego dopasowywania funkcji w kierunku wyuczonych funkcji, wyuczonej głębi i kompleksowego neuronowego SLAM, który jest bardziej niezawodny, do ścian pozbawionych tekstur, rozmycia ruchu i zmieniającego się światła. Neuronowe pola promieniowania i rozpryski gaussowskie są łączone w SLAM, aby stworzyć gęste, fotorealistyczne mapy, a nie rzadkie chmury punktów. Spodziewaj się ściślejszej fuzji wizualno-inercyjnej w telefonach i zestawach słuchawkowych, a także semantycznego SLAM, który oznacza obiekty, umożliwiając robotom wnioskowanie o scenie, a nie tylko poruszanie się po jej geometrii.
Implementacja w świecie rzeczywistym
Śledzenie pozycji od wewnątrz na zewnątrz w zestawach słuchawkowych Meta Quest i Apple Vision Pro, lokalizowanie użytkownika w pomieszczeniu bez zewnętrznych stacji bazowych
Apple ARKit i Google ARCore mocujące wirtualne meble lub postacie z gier do prawdziwych podłóg i stołów na telefonach
Łaziki marsjańskie NASA wykorzystują odometrię wizualną i mapy do poruszania się po terenie, gdzie nie ma GPS
Autonomiczne roboty magazynowe i roboty dostawcze tworzą mapy pięter i lokalizują pomiędzy półkami
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual SLAM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Rozumowanie wizualne
Często zadawane pytania
Czym jest Visual SLAM?
Visual SLAM pozwala poruszającej się kamerze stworzyć mapę nieznanej przestrzeni, jednocześnie śledząc własną pozycję na tej mapie. Stanowi przestrzenny szkielet robotów, dronów, zestawów słuchawkowych AR i funkcji autonomicznych.
Co oznacza skrót SLAM?
SLAM oznacza jednoczesną lokalizację i mapowanie: budowanie mapy i jednoczesne ustalanie na niej swojej pozycji.
Dlaczego jednooczny (pojedynczy aparat) wizualny SLAM nie jest w stanie samodzielnie odzyskać skali absolutnej?
Dzięki jednej kamerze i żadnej innej wskazówce mała pobliska scena i duża odległa scena mogą wyglądać identycznie, więc prawdziwa skala metryczna jest niejednoznaczna bez stereo i IMU.
Jaki jest cel zamknięcia pętli w systemie SLAM?
Małe błędy śledzenia kumulują się z czasem w postaci dryfu; wykrycie, że kamera powróciła do znanego miejsca, pozwala systemowi skorygować całą trajektorię.
Co optymalizuje dopasowanie pakietu w zapleczu SLAM?
Regulacja pakietu wspólnie udoskonala wiele pozycji kamer i punktów na mapie, tak aby rzutowane punkty 3D najlepiej pasowały do miejsc, w których faktycznie pojawiają się obiekty na obrazach.
Dlaczego IMU (inercyjna jednostka miary) jest często łączona z kamerami w wizualnym SLAM?
Akcelerometry i żyroskopy dostarczają szacunków ruchu, które stabilizują śledzenie poprzez rozmycie ruchu i pomagają rozwiązać skalę, czego nie jest w stanie osiągnąć pojedyncza kamera.