視覺人工智慧指南

人體姿勢估計

人體姿勢估計可偵測身體關節(例如手肘、膝蓋和肩膀)的位置,以根據影像或影片建立人的數位骨架。

閱讀時間約2分鐘最後更新

概述

It turns raw pixels into structured data about how people move.

深入探討

姿勢估計定位一組身體關鍵點(通常是 17 到 33 個關節)並將它們連接成骨架。存在兩種主要策略。自上而下的方法首先用邊界框檢測每個人,然後估計其中的關節;當很多人在場時,它們很準確,但速度很慢。自下而上的方法(例如 OpenPose)會立即偵測影像中的所有關鍵點,然後將它們分組為個體,以便在人群中可以更好地擴展。模型可以輸出 2D 座標或將其提升為 3D。流行的工具包括 OpenPose、Google 的 MoveNet 和 MediaPipe 以及 HRNet,後者保留了用於精確聯合定位的高解析度特徵。該技術為健身應用、動作捕捉和運動分析提供支援。

技術洞察

最準確的模型不是直接回歸關節座標,而是預測每個關節的熱圖,這是一個機率圖,其最亮的像素標記可能的關節位置。自下而上的系統添加了部分親和力場,即編碼四肢方向的向量圖,因此即使人員重疊,檢測到的關鍵點也可以連結到正確的骨骼中。像 HRNet 這樣的高解析度主幹網可以在整個網路中保持精細的空間細節,從而提高小型或緊密間隔關節的精確度。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

人體姿勢估計的未來

姿勢估計正在向消費設備上的即時 3D、強大的多人追蹤以及全身加手加臉部模型發展,以實現更豐富的表情捕捉。無標記動作捕捉正在取代電影和生物力學領域昂貴的工作室套裝。期望與動作識別更緊密地融合,不僅可以了解姿勢,還可以了解活動,在醫療保健中越來越多地使用步態和復健分析,以及通過從不將視頻發送到雲端來保護隱私的設備上模型。

現實世界的實施

健身和瑜珈應用程式可檢查使用者的姿勢並透過手機相機計算重複次數

用於電影和視頻遊戲中動畫角色的無標記動作捕捉

運動分析測量運動員的關節角度、步幅和技術

物理治療和步態分析追蹤患者的復健和運動質量

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Human Pose Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

單目深度估計

常見問題

What is Human Pose Estimation?

人體姿勢估計可偵測身體關節(例如手肘、膝蓋和肩膀)的位置,以根據影像或影片建立人的數位骨架。它將原始像素轉化為有關人們如何移動的結構化資料。

人體姿態估計主要檢測什麼?

姿勢估計定位身體關鍵點,例如手肘、膝蓋和肩膀,然後將它們連結成骨架。

自上而下的姿態估計方法如何運作?

自上而下的方法首先用邊界框檢測每個人,然後估計其中的關節,這是準確的,但對許多人來說速度會變慢。

最準確的姿勢模型對每個關節而不是原始座標預測什麼?

模型通常輸出每個關節的熱圖,其最亮的像素指示最可能的關節位置,這比直接回歸訓練更穩定。

OpenPose 使用的零件關聯欄位有什麼幫助?

零件親和力場將肢體方向編碼為向量圖,即使人們重疊,也可以讓自下而上的方法正確連接關鍵點。

為什麼像 OpenPose 這樣的自下而上的方法在擁擠的場景中可以更好地擴展?

自下而上的方法一次檢測影像中的每個關鍵點,然後將它們分組,因此成本不會隨著每增加一個人而增加。