PRZEWODNIK Wizualnej AI

Wizualny SLAM

Visual SLAM pozwala poruszającej się kamerze stworzyć mapę nieznanej przestrzeni, jednocześnie śledząc własną pozycję na tej mapie.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Jest przestrzennym kręgosłupem robotów, dronów, zestawów AR i funkcji autonomicznej jazdy.

Głębokie nurkowanie

SLAM oznacza jednoczesną lokalizację i mapowanie, a wariant wizualny rozwiązuje ten problem za pomocą kamer zamiast (lub obok) lidaru lub radaru. Gdy kamera się porusza, system wykrywa charakterystyczne cechy, takie jak narożniki i krawędzie, dopasowuje je do klatek i wykorzystuje pozorny ruch tych punktów do oszacowania zarówno struktury 3D sceny, jak i trajektorii kamery. Najtrudniejszą częścią jest połączenie kury z jajkiem: potrzebujesz mapy, aby wiedzieć, gdzie jesteś, ale musisz wiedzieć, gdzie jesteś, aby ją zbudować. Visual SLAM radzi sobie z tym wspólnie, często udoskonalając tysiące punktów i póz na raz. Obsługuje ARKit, ARCore, śledzenie od środka Meta Quest, łaziki marsjańskie i roboty magazynowe pracujące w pomieszczeniach zamkniętych, gdzie zawodzi GPS.

Wgląd techniczny

Typowy potok ma interfejs, który śledzi funkcje klatka po klatce (przy użyciu ORB, SIFT lub bezpośrednich metod fotometrycznych) oraz tył, który optymalizuje mapę. Regulacja wiązki wspólnie minimalizuje błąd ponownej projekcji w wielu pozycjach kamery i punktach 3D, a zamknięcie pętli wykrywa, kiedy kamera ponownie odwiedza dane miejsce i koryguje nagromadzony dryft. Monokularowy SLAM nie jest w stanie odzyskać skali absolutnej, dlatego kamery stereoskopowe lub inercyjna jednostka pomiarowa (IMU) są połączone, aby to naprawić.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość wizualnego SLAM

Pole przesuwa się od ręcznie tworzonego dopasowywania funkcji w kierunku wyuczonych funkcji, wyuczonej głębi i kompleksowego neuronowego SLAM, który jest bardziej niezawodny, do ścian pozbawionych tekstur, rozmycia ruchu i zmieniającego się światła. Neuronowe pola promieniowania i rozpryski gaussowskie są łączone w SLAM, aby stworzyć gęste, fotorealistyczne mapy, a nie rzadkie chmury punktów. Spodziewaj się ściślejszej fuzji wizualno-inercyjnej w telefonach i zestawach słuchawkowych, a także semantycznego SLAM, który oznacza obiekty, umożliwiając robotom wnioskowanie o scenie, a nie tylko poruszanie się po jej geometrii.

Implementacja w świecie rzeczywistym

Śledzenie pozycji od wewnątrz na zewnątrz w zestawach słuchawkowych Meta Quest i Apple Vision Pro, lokalizowanie użytkownika w pomieszczeniu bez zewnętrznych stacji bazowych

Apple ARKit i Google ARCore mocujące wirtualne meble lub postacie z gier do prawdziwych podłóg i stołów na telefonach

Łaziki marsjańskie NASA wykorzystują odometrię wizualną i mapy do poruszania się po terenie, gdzie nie ma GPS

Autonomiczne roboty magazynowe i roboty dostawcze tworzą mapy pięter i lokalizują pomiędzy półkami

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

Czym jest Visual SLAM?

Visual SLAM pozwala poruszającej się kamerze stworzyć mapę nieznanej przestrzeni, jednocześnie śledząc własną pozycję na tej mapie. Stanowi przestrzenny szkielet robotów, dronów, zestawów słuchawkowych AR i funkcji autonomicznych.

Co oznacza skrót SLAM?

SLAM oznacza jednoczesną lokalizację i mapowanie: budowanie mapy i jednoczesne ustalanie na niej swojej pozycji.

Dlaczego jednooczny (pojedynczy aparat) wizualny SLAM nie jest w stanie samodzielnie odzyskać skali absolutnej?

Dzięki jednej kamerze i żadnej innej wskazówce mała pobliska scena i duża odległa scena mogą wyglądać identycznie, więc prawdziwa skala metryczna jest niejednoznaczna bez stereo i IMU.

Jaki jest cel zamknięcia pętli w systemie SLAM?

Małe błędy śledzenia kumulują się z czasem w postaci dryfu; wykrycie, że kamera powróciła do znanego miejsca, pozwala systemowi skorygować całą trajektorię.

Co optymalizuje dopasowanie pakietu w zapleczu SLAM?

Regulacja pakietu wspólnie udoskonala wiele pozycji kamer i punktów na mapie, tak aby rzutowane punkty 3D najlepiej pasowały do ​​miejsc, w których faktycznie pojawiają się obiekty na obrazach.

Dlaczego IMU (inercyjna jednostka miary) jest często łączona z kamerami w wizualnym SLAM?

Akcelerometry i żyroskopy dostarczają szacunków ruchu, które stabilizują śledzenie poprzez rozmycie ruchu i pomagają rozwiązać skalę, czego nie jest w stanie osiągnąć pojedyncza kamera.