PRZEWODNIK Wizualnej AI

Śledzenie wielu obiektów

Śledzenie wielu obiektów (MOT) podąża za wieloma obiektami – przechodniami, samochodami, graczami – w klatkach wideo, nadając każdemu z nich spójną tożsamość w czasie.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It's the backbone of autonomous driving perception, sports analytics, and smart-city traffic monitoring.

Głębokie nurkowanie

Śledzenie wielu obiektów odpowiada nie tylko na pytanie „co znajduje się w każdej klatce”, ale także na to, „które wykrycie w klatce drugiej to ten sam obiekt, co w klatce pierwszej”. Dominującym paradygmatem jest śledzenie przez wykrywanie: detektor obiektów (taki jak YOLO) znajduje ramki ograniczające w każdej klatce, a następnie moduł śledzący łączy je w czasie w trajektorie. SORT łączy filtr Kalmana, który przewiduje, gdzie przesunie się każdy obiekt, z węgierskim algorytmem zapewniającym optymalne dopasowanie pudełek. DeepSORT dodaje osadzanie wyuczonego wyglądu, dzięki czemu obiekty można ponownie zidentyfikować po okluzji. ByteTrack poprawił dokładność, łącząc również wykrycia o niskiej pewności zamiast je odrzucać. Główne trudności to okluzja, zmiany tożsamości (zamiana identyfikatorów, gdy obiekty krzyżują się), zatłoczone sceny oraz obiekty wchodzące lub wychodzące z kadru.

Wgląd techniczny

Urządzenie śledzące utrzymuje „ślad” każdego obiektu za pomocą modelu ruchu. Filtr Kalmana przewiduje następną pozycję każdej ścieżki; nowe wykrycia są dopasowywane do przewidywań poprzez obliczenie kosztu (nakładanie się/IoU plus podobieństwo wyglądu) i rozwiązywanie przypisania za pomocą algorytmu węgierskiego. Osadzanie wyglądu — kompaktowe wektory cech z sieci ponownej identyfikacji — pozwala systemowi odzyskać prawidłową tożsamość po krótkim ukryciu obiektu, zapobiegając przełączeniom identyfikatora, na które narażone są modele wykorzystujące wyłącznie ruch w zatłoczonych scenach.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość śledzenia wielu obiektów

Śledzenie zmierza w kierunku kompleksowych modeli transformatorów (takich jak TrackFormer i MOTR), które wspólnie wykrywają i wiążą obiekty w jednej sieci, eliminując kruchy, ręcznie dostrajany etap dopasowywania. Spodziewaj się lepszego śledzenia za pomocą wielu kamer i śledzenia 3D pojazdów autonomicznych i dużych obiektów, a także śledzenia dowolnych obiektów z otwartym słownictwem, a nie ustalonych kategorii. Lepsza długoterminowa ponowna identyfikacja i odporność na silną okluzję i tłumy pozostają aktywnymi celami, coraz częściej wspomaganymi przez modele podstawowe, które zapewniają bogate funkcje wizualne.

Implementacja w świecie rzeczywistym

Autonomiczna percepcja pojazdów, która śledzi otaczające samochody, rowerzystów i pieszych, aby przewidzieć ich ścieżki i uniknąć kolizji

Analityka sportowa, która śledzi każdego gracza i piłkę, aby obliczyć przebyty dystans, formacje i statystyki posiadania

Inteligentne systemy ruchu miejskiego, które zliczają i podążają za pojazdami w celu pomiaru przepływu, wykrywania zatorów i sygnałów czasowych

Analityka handlu detalicznego i bezpieczeństwa, która śledzi ruch kupujących w sklepie lub ludzi w węźle tranzytowym

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Object Tracking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Multi-Object Tracking?

Śledzenie wielu obiektów (MOT) podąża za wieloma obiektami – przechodniami, samochodami, graczami – w klatkach wideo, nadając każdemu z nich spójną tożsamość w czasie. Stanowi podstawę percepcji jazdy autonomicznej, analiz sportowych i monitorowania ruchu w inteligentnych miastach.

Jaki jest główny cel śledzenia wielu obiektów?

MOT przypisuje i utrzymuje spójny identyfikator każdemu obiektowi poruszającemu się w materiale wideo, łącząc wykrycia w czasie w trajektorie.

Na czym polega paradygmat „śledzenia przez wykrycie”?

Śledzenie przez wykrywanie uruchamia detektor obiektów w każdej klatce, a następnie łączy powstałe pola w czasie w ciągłe ścieżki.

Jaką rolę odgrywa filtr Kalmana w trackerach takich jak SORT?

Filtr Kalmana modeluje ruch każdego obiektu i przewiduje jego następną pozycję, która jest następnie dopasowywana do nowych wykryć.

Co DeepSORT dodał do SORT?

W DeepSORT wprowadzono wektory cech wyglądu, dzięki którym obiekty można ponownie zidentyfikować po krótkim ukryciu, co ogranicza konieczność zmiany tożsamości.

Co to jest „przełącznik tożsamości” w śledzeniu wielu obiektów?

Zmiana tożsamości ma miejsce, gdy moduł śledzący błędnie przypisuje identyfikatory między obiektami, zwykle gdy nakładają się lub krzyżują w zatłoczonych scenach.