تقدير الوضع البشري
يكتشف تقدير وضعية الإنسان مواقع مفاصل الجسم، مثل المرفقين والركبتين والكتفين، لبناء هيكل عظمي رقمي للشخص من الصور أو الفيديو.
نظرة عامة
It turns raw pixels into structured data about how people move.
الغوص العميق
يحدد تقدير الوضعية مجموعة من نقاط الجسم الرئيسية (عادةً من 17 إلى 33 مفصلاً) ويربطها بالهيكل العظمي. توجد استراتيجيتان رئيسيتان. تكتشف الطرق من أعلى إلى أسفل أولاً كل شخص لديه صندوق محيط، ثم تقدر المفاصل بداخله؛ فهي دقيقة ولكنها بطيئة عند وجود العديد من الأشخاص. تكتشف الأساليب من أسفل إلى أعلى، مثل OpenPose، جميع النقاط الرئيسية في الصورة مرة واحدة ثم تقوم بتجميعها في مجموعات فردية، وهو ما يتوسع بشكل أفضل في الحشود. يمكن للنماذج إخراج إحداثيات ثنائية الأبعاد أو تحويلها إلى إحداثيات ثلاثية الأبعاد. تشمل الأدوات الشائعة OpenPose وMoveNet وMediaPipe من Google وHRNet، التي تحافظ على الميزات عالية الدقة للتوطين المشترك الدقيق. تعمل هذه التقنية على تشغيل تطبيقات اللياقة البدنية والتقاط الحركة والتحليلات الرياضية.
البصيرة الفنية
بدلًا من تراجع إحداثيات المفاصل مباشرةً، تتنبأ النماذج الأكثر دقة بخريطة حرارية لكل مفصل، وهي خريطة احتمالية تحدد بيكسلاتها الأكثر سطوعًا الموقع المشترك المحتمل. تضيف الأنظمة من الأسفل إلى الأعلى حقول تقارب الأجزاء، وهي خرائط متجهة تشفر اتجاه الأطراف، بحيث يمكن ربط نقاط المفاتيح المكتشفة بالهياكل العظمية الصحيحة حتى مع الأشخاص المتداخلين. تحافظ الهياكل الأساسية عالية الدقة مثل HRNet على تفاصيل مكانية دقيقة في جميع أنحاء الشبكة، مما يؤدي إلى تحسين الدقة للمفاصل الصغيرة أو المتقاربة.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل تقدير الوضع البشري
يتجه تقدير الوضعية نحو التصوير ثلاثي الأبعاد في الوقت الفعلي على الأجهزة الاستهلاكية، والتتبع القوي لعدة أشخاص، ونماذج الجسم بالكامل بالإضافة إلى اليد والوجه لالتقاط تعبيرات أكثر ثراءً. يحل التقاط الحركة بدون علامات محل بدلات الاستوديو باهظة الثمن في الأفلام والميكانيكا الحيوية. توقع اندماجًا أكثر صرامة مع التعرف على الحركة لفهم ليس فقط الوضعية بل النشاط، والاستخدام المتزايد في الرعاية الصحية لتحليل المشية وإعادة التأهيل، والنماذج الموجودة على الجهاز التي تحمي الخصوصية من خلال عدم إرسال الفيديو إلى السحابة مطلقًا.
التنفيذ في العالم الحقيقي
تطبيقات اللياقة البدنية واليوجا التي تتحقق من شكل المستخدم وتحسب التكرارات من كاميرا الهاتف
التقاط حركة بدون علامات لتحريك الشخصيات في الأفلام وألعاب الفيديو
تحليلات رياضية تقيس زوايا مفصل الرياضي وخطوته وتقنياته
العلاج الطبيعي وتحليل المشية يتتبع تعافي المريض وجودة حركته
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Human Pose Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تقدير عمق أحادي
الأسئلة المتداولة
What is Human Pose Estimation?
يكتشف تقدير وضعية الإنسان مواقع مفاصل الجسم، مثل المرفقين والركبتين والكتفين، لبناء هيكل عظمي رقمي للشخص من الصور أو الفيديو. فهو يحول وحدات البكسل الأولية إلى بيانات منظمة حول كيفية تحرك الأشخاص.
ما الذي يكشفه تقدير وضعية الإنسان في المقام الأول؟
يحدد تقدير الوضعية نقاط الجسم الرئيسية مثل المرفقين والركبتين والكتفين، ثم يربطها بالهيكل العظمي.
كيف تعمل طرق تقدير الوضعية من أعلى إلى أسفل؟
تكتشف الطرق من أعلى إلى أسفل أولاً كل شخص لديه صندوق محيط، ثم تقوم بتقدير المفاصل داخله، وهو أمر دقيق ولكنه يتباطأ مع العديد من الأشخاص.
ما الذي تتوقعه نماذج الوضع الأكثر دقة لكل مفصل بدلاً من الإحداثيات الأولية؟
تقوم النماذج عادةً بإخراج خريطة حرارية لكل مفصل تشير وحدات البكسل الأكثر سطوعًا فيها إلى موضع المفصل الأكثر احتمالاً، والذي يتدرب بشكل أكثر ثباتًا من الانحدار المباشر.
ما الذي تساعد فيه حقول تقارب الأجزاء التي يستخدمها OpenPose؟
تقوم حقول تقارب الأجزاء بتشفير اتجاه الأطراف كخرائط متجهة، مما يسمح للطرق التنازلية بتوصيل نقاط المفاتيح بشكل صحيح حتى عندما يتداخل الأشخاص.
لماذا تتوسع الأساليب من أسفل إلى أعلى مثل OpenPose بشكل أفضل في المشاهد المزدحمة؟
تكتشف الأساليب من الأسفل إلى الأعلى كل نقطة رئيسية في الصورة في مسار واحد ثم تقوم بتجميعها، بحيث لا تزيد التكلفة مع كل شخص إضافي.