PRZEWODNIK Wizualnej AI

Oszacowanie pozycji człowieka

Oszacowanie pozycji człowieka wykrywa położenie stawów ciała, takich jak łokcie, kolana i ramiona, w celu zbudowania cyfrowego szkieletu osoby na podstawie zdjęć lub wideo.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It turns raw pixels into structured data about how people move.

Głębokie nurkowanie

Oszacowanie pozycji lokalizuje zestaw kluczowych punktów ciała (zwykle od 17 do 33 stawów) i łączy je w szkielet. Istnieją dwie główne strategie. Metody odgórne najpierw wykrywają każdą osobę za pomocą ramki ograniczającej, a następnie szacują znajdujące się w niej połączenia; są dokładne, ale powolne, gdy obecnych jest wiele osób. Metody oddolne, takie jak OpenPose, wykrywają wszystkie kluczowe punkty obrazu na raz, a następnie grupują je w pojedyncze osoby, co lepiej skaluje się w tłumie. Modele mogą wyprowadzać współrzędne 2D lub przenosić je do 3D. Popularne narzędzia obejmują OpenPose, MoveNet i MediaPipe firmy Google oraz HRNet, który zachowuje funkcje wysokiej rozdzielczości w celu precyzyjnej lokalizacji połączeń. Technologia ta obsługuje aplikacje fitness, przechwytywanie ruchu i analitykę sportową.

Wgląd techniczny

Zamiast bezpośrednio regresować współrzędne stawów, najdokładniejsze modele przewidują mapę cieplną każdego złącza, czyli mapę prawdopodobieństwa, której najjaśniejszy piksel oznacza prawdopodobną lokalizację złącza. Systemy oddolne dodają pola powinowactwa części, mapy wektorowe kodujące kierunek kończyn, dzięki czemu wykryte punkty kluczowe można połączyć w prawidłowe szkielety, nawet w przypadku nakładających się osób. Szkielety o wysokiej rozdzielczości, takie jak HRNet, zachowują drobne szczegóły przestrzenne w całej sieci, poprawiając precyzję w przypadku małych lub blisko rozmieszczonych połączeń.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość szacowania pozycji człowieka

Ocenianie pozycji zmierza w kierunku trójwymiarowego obrazu w czasie rzeczywistym na urządzeniach konsumenckich, niezawodnego śledzenia wieloosobowego i modeli całego ciała plus ręka plus twarz w celu bogatszego uchwycenia ekspresji. Przechwytywanie ruchu bez znaczników zastępuje drogie garnitury studyjne w filmie i biomechanice. Spodziewaj się ściślejszego połączenia z rozpoznawaniem działań, aby zrozumieć nie tylko postawę, ale także aktywność, rosnącego zastosowania w opiece zdrowotnej do analizy chodu i rehabilitacji oraz modeli na urządzeniach, które chronią prywatność, nigdy nie wysyłając wideo do chmury.

Implementacja w świecie rzeczywistym

Aplikacje fitness i jogi, które sprawdzają formę użytkownika i liczą powtórzenia za pomocą aparatu w telefonie

Przechwytywanie ruchu bez znaczników do animowania postaci w filmach i grach wideo

Analityka sportowa mierząca kąty stawów, krok i technikę sportowca

Fizjoterapia i analiza chodu śledząca powrót do zdrowia i jakość ruchu pacjenta

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Human Pose Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szacowanie głębokości jednoocznej

Często zadawane pytania

What is Human Pose Estimation?

Oszacowanie pozycji człowieka wykrywa położenie stawów ciała, takich jak łokcie, kolana i ramiona, w celu zbudowania cyfrowego szkieletu osoby na podstawie zdjęć lub wideo. Zamienia surowe piksele w uporządkowane dane o tym, jak ludzie się poruszają.

Co przede wszystkim wykrywa ocena pozycji człowieka?

Oszacowanie pozycji lokalizuje kluczowe punkty ciała, takie jak łokcie, kolana i ramiona, a następnie łączy je w szkielet.

Jak działają metody szacowania pozycji z góry na dół?

Metody odgórne najpierw wykrywają każdą osobę za pomocą ramki ograniczającej, a następnie szacują znajdujące się w niej połączenia, co jest dokładne, ale w przypadku wielu osób jest wolniejsze.

Co najdokładniejsze modele ułożenia przewidują dla każdego stawu zamiast surowych współrzędnych?

Modele zazwyczaj generują mapę cieplną poszczególnych stawów, której najjaśniejszy piksel wskazuje najbardziej prawdopodobną pozycję stawu, co jest bardziej stabilne niż regresja bezpośrednia.

W czym pomagają pola Part Affinity Fields, wykorzystywane przez OpenPose?

Pola powinowactwa części kodują kierunek kończyn w postaci map wektorowych, umożliwiając metodom oddolnym prawidłowe łączenie kluczowych punktów nawet wtedy, gdy ludzie nakładają się na siebie.

Dlaczego metody oddolne, takie jak OpenPose, lepiej skalują się w zatłoczonych scenach?

Metody oddolne wykrywają każdy punkt kluczowy obrazu w jednym przebiegu, a następnie grupują je, dzięki czemu koszt nie rośnie wraz z każdą dodatkową osobą.