GUIDA AI visiva

Flusso ottico

Il flusso ottico stima il modo in cui ciascun pixel si muove tra fotogrammi video consecutivi, producendo una fitta mappa di vettori di movimento.

2 minuti di letturaUltimo aggiornamento

Panoramica

È il modo in cui le macchine percepiscono movimento, velocità e direzione nel video.

Immersione profonda

Il flusso ottico assegna una minuscola freccia di movimento a ogni pixel, descrivendo dove sembra viaggiare da un fotogramma a quello successivo. I metodi classici si basano sul presupposto della "costanza della luminosità" (un punto mantiene la stessa luminosità mentre si muove) combinato con vincoli di levigatezza, come negli algoritmi di Lucas-Kanade (sparso) e Horn-Schunck (denso). Funzionano bene per movimenti piccoli e delicati, ma hanno difficoltà con movimenti rapidi, occlusioni e grandi regioni senza texture. Il deep learning ha cambiato il campo: reti come FlowNet, PWC-Net e soprattutto RAFT imparano ad abbinare le funzionalità tra i frame e a perfezionare in modo iterativo il campo di flusso. L'output guida la comprensione del video ovunque la domanda non sia semplicemente "cosa c'è nell'inquadratura?" ma 'come si muove?'

Approfondimento tecnico

RAFT, un approccio fondamentale, crea un "volume di costo" 4D che valuta quanto bene ogni pixel nel fotogramma uno corrisponde a ogni pixel nel fotogramma due, quindi utilizza un operatore di aggiornamento ricorrente (un GRU) per affinare la stima del flusso in molti piccoli passaggi, come spingere ripetutamente le frecce verso corrispondenze migliori. Questo perfezionamento iterativo, piuttosto che una grande ipotesi, fornisce un flusso nitido e accurato anche per grandi spostamenti e dettagli fini, e si generalizza bene in scene diverse.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro del flusso ottico

Il flusso ottico si sta muovendo verso una stima in tempo reale e ad alta risoluzione sui dispositivi edge, una più stretta integrazione con la profondità e il flusso delle scene 3D e una formazione auto-supervisionata che apprende dai video grezzi senza costose etichette di verità sul campo. Poiché i sistemi autonomi e i robot richiedono una comprensione del movimento più approfondita, aspettatevi che il flusso si fonda con il tracciamento e la previsione degli oggetti in modo che le macchine non solo vedano il movimento attuale ma anticipino dove andranno le cose dopo, anche attraverso occlusioni e movimenti rapidi della telecamera.

Implementazione nel mondo reale

Stabilizzazione video nei telefoni e nelle action camera che annulla i movimenti tremolanti del palmare

Interpolazione dei fotogrammi che genera fotogrammi intermedi per rendere il video più fluido o eseguirlo al rallentatore

Assistenza alla guida e veicoli autonomi che stimano la velocità e la direzione delle auto e dei pedoni nelle vicinanze

Codec di compressione video che prevedono il movimento tra i fotogrammi per archiviare il video in modo più efficiente

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Flow quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Corrispondenza del flusso

Domande frequenti

Cos'è il flusso ottico?

Il flusso ottico stima il modo in cui ciascun pixel si muove tra fotogrammi video consecutivi, producendo una fitta mappa di vettori di movimento. È il modo in cui le macchine percepiscono il movimento, la velocità e la direzione nei video.

Cosa stima effettivamente il flusso ottico?

Il flusso ottico produce vettori di movimento che descrivono come ciascun pixel si sposta da un fotogramma a quello successivo.

Qual è il presupposto della "costanza della luminosità" utilizzato nel flusso ottico classico?

I metodi classici presuppongono che la luminosità di un punto fisico rimanga costante mentre si muove, il che consente loro di abbinarla tra i fotogrammi.

Quale metodo moderno di deep learning è noto per il perfezionamento del flusso iterativo utilizzando un volume di costi e aggiornamenti ricorrenti?

RAFT crea un volume di costo 4D e utilizza un operatore ricorrente per perfezionare il flusso in molti piccoli passaggi, ottenendo una precisione all'avanguardia.

Perché i metodi classici del flusso ottico hanno difficoltà con movimenti ampi e veloci?

I metodi basati su presupposti di piccolo movimento perdono traccia quando un pixel salta molto tra i fotogrammi, causando errori.

Quale applicazione si basa direttamente sulla stima del movimento tra i fotogrammi?

L'interpolazione dei fotogrammi sintetizza i fotogrammi intermedi utilizzando il movimento stimato dei pixel, producendo video più fluidi o al rallentatore.