GUIDA AI visiva

Stima della posa umana

La stima della posa umana rileva le posizioni delle articolazioni del corpo, come gomiti, ginocchia e spalle, per costruire uno scheletro digitale di una persona da immagini o video.

2 minuti di letturaUltimo aggiornamento

Panoramica

It turns raw pixels into structured data about how people move.

Immersione profonda

La stima della posa individua una serie di punti chiave del corpo (tipicamente da 17 a 33 articolazioni) e li collega in uno scheletro. Esistono due strategie principali. I metodi top-down rilevano innanzitutto ogni persona con un riquadro di delimitazione, quindi stimano i giunti al suo interno; sono precisi ma lenti quando sono presenti molte persone. I metodi bottom-up, come OpenPose, rilevano tutti i punti chiave dell’immagine contemporaneamente e quindi li raggruppano in individui, il che si adatta meglio alla folla. I modelli possono generare coordinate 2D o sollevarle in 3D. Gli strumenti più diffusi includono OpenPose, MoveNet e MediaPipe di Google e HRNet, che conserva funzionalità ad alta risoluzione per una precisa localizzazione congiunta. La tecnologia è alla base delle app per il fitness, del motion capture e dell'analisi sportiva.

Approfondimento tecnico

Invece di regredire direttamente le coordinate dei giunti, i modelli più accurati prevedono una mappa termica per giunto, una mappa di probabilità il cui pixel più luminoso indica la probabile posizione del giunto. I sistemi bottom-up aggiungono Part Affinity Fields, mappe vettoriali che codificano la direzione degli arti, in modo che i punti chiave rilevati possano essere collegati in scheletri corretti anche con persone sovrapposte. Le dorsali ad alta risoluzione come HRNet mantengono dettagli spaziali precisi in tutta la rete, migliorando la precisione per giunti piccoli o ravvicinati.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro della stima della posa umana

La stima della posa si sta spostando verso il 3D in tempo reale sui dispositivi consumer, un robusto monitoraggio di più persone e modelli completi di corpo più mani e viso per una cattura di espressioni più ricca. La motion capture senza marcatori sta sostituendo le costose tute da studio nel cinema e nella biomeccanica. Si prevede una fusione più stretta con il riconoscimento delle azioni per comprendere non solo la postura ma anche l'attività, un utilizzo crescente in ambito sanitario per l'analisi dell'andatura e della riabilitazione e modelli su dispositivo che proteggano la privacy non inviando mai video al cloud.

Implementazione nel mondo reale

App di fitness e yoga che controllano il modulo di un utente e contano le ripetizioni dalla fotocamera del telefono

Motion capture senza marcatori per animare personaggi di film e videogiochi

Analisi sportiva che misura gli angoli articolari, il passo e la tecnica di un atleta

Terapia fisica e analisi dell'andatura che monitorano il recupero e la qualità del movimento del paziente

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Human Pose Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Stima della profondità monoculare

Domande frequenti

What is Human Pose Estimation?

La stima della posa umana rileva le posizioni delle articolazioni del corpo, come gomiti, ginocchia e spalle, per costruire uno scheletro digitale di una persona da immagini o video. Trasforma i pixel grezzi in dati strutturati su come si muovono le persone.

Cosa rileva principalmente la stima della posa umana?

La stima della posa individua i punti chiave del corpo come gomiti, ginocchia e spalle, quindi li collega in uno scheletro.

Come funzionano i metodi di stima della posa top-down?

I metodi top-down rilevano innanzitutto ogni persona con un riquadro di delimitazione e quindi stimano le articolazioni al suo interno, il che è accurato ma rallenta con molte persone.

Cosa prevedono i modelli di posa più accurati per ciascuna articolazione anziché le coordinate grezze?

I modelli in genere producono una mappa termica per giunto il cui pixel più luminoso indica la posizione congiunta più probabile, che si allena in modo più stabile rispetto alla regressione diretta.

In cosa aiutano i campi Part Affinity Fields, utilizzati da OpenPose?

I campi di affinità delle parti codificano la direzione degli arti come mappe vettoriali, consentendo ai metodi bottom-up di collegare correttamente i punti chiave anche quando le persone si sovrappongono.

Perché i metodi bottom-up come OpenPose si adattano meglio alle scene affollate?

I metodi bottom-up rilevano ogni punto chiave dell'immagine in un unico passaggio e quindi li raggruppano, in modo che il costo non aumenti con ogni persona aggiuntiva.