GUIDA AI visiva

Tracciamento di più oggetti

Il tracciamento multi-oggetto (MOT) segue molti oggetti (pedoni, automobili, giocatori) attraverso i fotogrammi di un video, conferendo a ciascuno un'identità coerente nel tempo.

2 minuti di letturaUltimo aggiornamento

Panoramica

È la spina dorsale della percezione della guida autonoma, dell'analisi sportiva e del monitoraggio del traffico nelle smart city.

Immersione profonda

Il tracciamento di più oggetti risponde non solo a "cosa c'è in ogni fotogramma" ma "quale rilevamento nel fotogramma due è lo stesso oggetto del fotogramma uno". Il paradigma dominante è il tracciamento per rilevamento: un rilevatore di oggetti (come YOLO) trova riquadri di delimitazione in ogni fotogramma, quindi un tracker li collega nel tempo in traiettorie. SORT abbina un filtro di Kalman, che prevede dove si sposterà ciascun oggetto, con l'algoritmo ungherese per una corrispondenza ottimale dei riquadri. DeepSORT aggiunge un incorporamento dell'aspetto appreso in modo che gli oggetti possano essere nuovamente identificati dopo l'occlusione. ByteTrack ha migliorato la precisione associando anche rilevamenti poco affidabili invece di scartarli. Le difficoltà principali sono l'occlusione, i cambi di identità (scambio di ID quando gli oggetti si incrociano), scene affollate e oggetti che entrano o escono dall'inquadratura.

Approfondimento tecnico

Un tracker mantiene una "traccia" per ciascun oggetto con un modello di movimento. Il filtro Kalman prevede la posizione successiva di ciascuna traccia; i nuovi rilevamenti vengono abbinati alle previsioni calcolando un costo (sovrapposizione/IoU più somiglianza estetica) e risolvendo l'assegnazione con l'algoritmo ungherese. Gli incorporamenti dell'aspetto - vettori di caratteristiche compatti da una rete di reidentificazione - consentono al sistema di recuperare l'identità corretta dopo che un oggetto è stato brevemente nascosto, prevenendo i cambi di ID che subiscono i modelli di puro movimento nelle scene affollate.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro del tracciamento multi-oggetto

Il tracciamento si sta spostando verso modelli di trasformatori end-to-end (come TrackFormer e MOTR) che rilevano e associano congiuntamente oggetti in un'unica rete, rimuovendo la fragile fase di abbinamento manuale. Aspettatevi un tracciamento multi-camera e 3D più potente per veicoli autonomi e luoghi di grandi dimensioni, oltre al tracciamento di oggetti arbitrari e con vocabolario aperto anziché di categorie fisse. Una migliore reidentificazione a lungo termine e la resistenza all’occlusione pesante e alle folle rimangono obiettivi attivi, sempre più aiutati da modelli di base che forniscono ricche funzionalità visive.

Implementazione nel mondo reale

Percezione del veicolo autonomo che traccia le auto, i ciclisti e i pedoni circostanti per prevederne il percorso ed evitare collisioni

Analisi sportive che seguono ogni giocatore e la palla per calcolare la distanza percorsa, le formazioni e le statistiche di possesso palla

Sistemi di traffico cittadino intelligente che contano e seguono i veicoli per misurare il flusso, rilevare la congestione e i segnali orari

Analisi di vendita al dettaglio e di sicurezza che tengono traccia del movimento degli acquirenti attraverso un negozio o delle persone attraverso un hub di transito

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Object Tracking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Rilevamento oggetti

Domande frequenti

Cos'è il tracciamento multi-oggetto?

Il tracciamento multi-oggetto (MOT) segue molti oggetti (pedoni, automobili, giocatori) attraverso i fotogrammi di un video, conferendo a ciascuno un'identità coerente nel tempo. È la spina dorsale della percezione della guida autonoma, dell'analisi sportiva e del monitoraggio del traffico delle città intelligenti.

Qual è l'obiettivo principale del tracciamento di più oggetti?

Il MOT assegna e mantiene un ID coerente per ciascun oggetto mentre si muove attraverso un video, collegando i rilevamenti nel tempo in traiettorie.

Cosa comporta il paradigma del "tracciamento per rilevamento"?

Il tracciamento per rilevamento esegue un rilevatore di oggetti in ciascun fotogramma e quindi associa i riquadri risultanti nel tempo in tracce continue.

Che ruolo gioca il filtro di Kalman nei tracker come SORT?

Il filtro di Kalman modella il movimento di ogni oggetto e ne prevede la posizione successiva, che viene poi abbinata ai nuovi rilevamenti.

Cosa ha aggiunto DeepSORT oltre a SORT?

DeepSORT ha introdotto i vettori delle caratteristiche dell'aspetto in modo che gli oggetti possano essere nuovamente identificati dopo essere stati brevemente nascosti, riducendo i cambi di identità.

Che cos'è un "cambio di identità" nel tracciamento di più oggetti?

Un cambio di identità si verifica quando un tracker riassegna erroneamente gli ID tra gli oggetti, comunemente quando si sovrappongono o si incrociano in scene affollate.