Schatting van de menselijke houding
Bij het schatten van menselijke poses worden de posities van lichaamsgewrichten, zoals ellebogen, knieën en schouders, gedetecteerd om op basis van afbeeldingen of video een digitaal skelet van een persoon op te bouwen.
Overzicht
It turns raw pixels into structured data about how people move.
Diepe duik
Bij het schatten van de houding wordt een reeks lichaamssleutelpunten (meestal 17 tot 33 gewrichten) gelokaliseerd en met elkaar verbonden tot een skelet. Er bestaan twee hoofdstrategieën. Top-down-methoden detecteren eerst elke persoon met een selectiekader en schatten vervolgens de gewrichten daarin; ze zijn nauwkeurig maar traag als er veel mensen aanwezig zijn. Bottom-up-methoden, zoals OpenPose, detecteren alle belangrijke punten in het beeld in één keer en groeperen ze vervolgens in individuen, wat beter schaalt in een menigte. Modellen kunnen 2D-coördinaten uitvoeren of deze naar 3D tillen. Populaire tools zijn onder meer OpenPose, MoveNet en MediaPipe van Google, en HRNet, dat functies met hoge resolutie behoudt voor nauwkeurige gezamenlijke lokalisatie. De technologie drijft fitness-apps, bewegingsregistratie en sportanalyses aan.
Technisch inzicht
In plaats van de gewrichtscoördinaten direct te regressieren, voorspellen de meeste nauwkeurige modellen een heatmap per gewricht, een waarschijnlijkheidskaart waarvan de helderste pixel de waarschijnlijke gewrichtslocatie markeert. Bottom-up systemen voegen Part Affinity Fields toe, vectorkaarten die de richting van ledematen coderen, zodat gedetecteerde sleutelpunten kunnen worden gekoppeld aan correcte skeletten, zelfs als er sprake is van overlappende mensen. Backbones met hoge resolutie, zoals HRNet, behouden fijne ruimtelijke details in het hele netwerk, waardoor de precisie voor kleine of dicht bij elkaar geplaatste verbindingen wordt verbeterd.
Strategische impact
Speed and scale
Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.
Build choices
Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.
Team and workflow
Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.
De toekomst van schatting van menselijke poses
Het schatten van poses evolueert richting real-time 3D op consumentenapparaten, robuuste tracking van meerdere personen en modellen van het volledige lichaam plus hand plus gezicht voor rijkere gezichtsuitdrukkingen. Markerless motion capture vervangt dure studiopakken in film en biomechanica. Verwacht een nauwere combinatie met actieherkenning om niet alleen houding maar ook activiteit te begrijpen, een groeiend gebruik in de gezondheidszorg voor loop- en revalidatieanalyse, en modellen op apparaten die de privacy beschermen door nooit video naar de cloud te sturen.
Implementatie in de echte wereld
Fitness- en yoga-apps die de vorm van een gebruiker controleren en herhalingen tellen vanaf een telefooncamera
Motion capture zonder markeringen voor het animeren van personages in films en videogames
Sportanalyse die de gewrichtshoeken, pasbewegingen en techniek van een atleet meet
Fysiotherapie en loopanalyse volgen het herstel en de bewegingskwaliteit van een patiënt
Risico's en vangrails
Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.
De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.
Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.
Implementatie routekaart
Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.
Test met gegevens die overeenkomen met echte productieomstandigheden.
Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.
Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Human Pose Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Monoculaire diepteschatting
Frequently asked questions
What is Human Pose Estimation?
Bij het schatten van menselijke poses worden de posities van lichaamsgewrichten, zoals ellebogen, knieën en schouders, gedetecteerd om op basis van afbeeldingen of video een digitaal skelet van een persoon op te bouwen. Het zet ruwe pixels om in gestructureerde gegevens over hoe mensen bewegen.
Wat detecteert de schatting van de menselijke pose voornamelijk?
Bij het schatten van de houding worden belangrijke lichaamspunten, zoals ellebogen, knieën en schouders, gelokaliseerd en vervolgens aan een skelet gekoppeld.
Hoe werken top-down pose-schattingsmethoden?
Top-down-methoden detecteren eerst elke persoon met een selectiekader en schatten vervolgens de gewrichten daarin, wat nauwkeurig is, maar bij veel mensen langzamer gaat.
Wat voorspellen de meest nauwkeurige pose-modellen voor elk gewricht in plaats van ruwe coördinaten?
Modellen voeren doorgaans een heatmap per gewricht uit waarvan de helderste pixel de meest waarschijnlijke gewrichtspositie aangeeft, wat stabieler traint dan directe regressie.
Waar helpen Part Affinity Fields, gebruikt door OpenPose, bij?
Gedeeltelijke affiniteitsvelden coderen de richting van ledematen als vectorkaarten, waardoor bottom-up-methoden sleutelpunten correct kunnen verbinden, zelfs als mensen elkaar overlappen.
Waarom schalen bottom-up-methoden zoals OpenPose beter in drukke scènes?
Bottom-up-methoden detecteren elk belangrijk punt in het beeld in één keer en groeperen ze vervolgens, zodat de kosten niet met elke extra persoon stijgen.