การประมาณท่าทางของมนุษย์
การประมาณท่าทางของมนุษย์จะตรวจจับตำแหน่งของข้อต่อต่างๆ ของร่างกาย เช่น ข้อศอก เข่า และไหล่ เพื่อสร้างโครงกระดูกดิจิทัลของบุคคลจากรูปภาพหรือวิดีโอ
ภาพรวม
It turns raw pixels into structured data about how people move.
เจาะลึก
การประมาณท่าทางจะค้นหาชุดของจุดสำคัญของร่างกาย (โดยทั่วไปคือข้อต่อ 17 ถึง 33 ข้อ) และเชื่อมต่อเข้ากับโครงกระดูก มีกลยุทธ์หลักสองประการ วิธีจากบนลงล่างจะตรวจจับแต่ละคนด้วยกล่องขอบเขต จากนั้นประมาณข้อต่อที่อยู่ภายในกล่องนั้น ถูกต้องแต่ช้าเมื่อมีคนจำนวนมากอยู่ วิธีการจากล่างขึ้นบน เช่น OpenPose จะตรวจจับจุดสำคัญทั้งหมดในภาพพร้อมกัน จากนั้นจัดกลุ่มเป็นรายบุคคล ซึ่งจะขยายขนาดได้ดีกว่าในฝูงชน โมเดลสามารถส่งออกพิกัด 2D หรือยกให้เป็น 3D เครื่องมือยอดนิยม ได้แก่ OpenPose, MoveNet และ MediaPipe ของ Google และ HRNet ซึ่งรักษาคุณสมบัติที่มีความละเอียดสูงไว้เพื่อการแปลร่วมที่แม่นยำ เทคโนโลยีนี้ขับเคลื่อนแอปฟิตเนส การจับการเคลื่อนไหว และการวิเคราะห์กีฬา
ข้อมูลเชิงลึกทางเทคนิค
แทนที่จะถดถอยพิกัดข้อต่อโดยตรง แบบจำลองที่แม่นยำที่สุดทำนายแผนที่ความร้อนต่อข้อต่อ ซึ่งเป็นแผนที่ความน่าจะเป็นที่มีพิกเซลที่สว่างที่สุดทำเครื่องหมายตำแหน่งที่เป็นไปได้ของข้อต่อ ระบบจากล่างขึ้นบนเพิ่ม Part Affinity Field แผนที่เวกเตอร์ที่เข้ารหัสทิศทางของแขนขา ดังนั้นจุดสำคัญที่ตรวจพบจึงสามารถเชื่อมโยงเข้ากับโครงกระดูกที่ถูกต้องได้แม้จะมีคนที่ทับซ้อนกันก็ตาม แกนหลักที่มีความละเอียดสูง เช่น HRNet จะรักษารายละเอียดเชิงพื้นที่อย่างละเอียดทั่วทั้งเครือข่าย ปรับปรุงความแม่นยำสำหรับข้อต่อขนาดเล็กหรือที่มีระยะห่างใกล้เคียงกัน
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการประมาณค่าท่าทางของมนุษย์
การประมาณท่าทางกำลังเคลื่อนไปสู่ 3D แบบเรียลไทม์บนอุปกรณ์ของผู้บริโภค การติดตามบุคคลหลายคนที่มีประสิทธิภาพ และแบบจำลองเต็มร่างกายบวกมือบวกใบหน้าเพื่อการจับภาพการแสดงออกที่สมบูรณ์ยิ่งขึ้น การจับภาพเคลื่อนไหวแบบไม่มีเครื่องหมายกำลังเข้ามาแทนที่ชุดสตูดิโอราคาแพงในภาพยนตร์และชีวกลศาสตร์ คาดหวังการผสมผสานที่แน่นแฟ้นยิ่งขึ้นกับการจดจำการกระทำเพื่อทำความเข้าใจไม่เพียงแต่ท่าทางแต่ยังเป็นกิจกรรม การใช้งานที่เพิ่มขึ้นในการดูแลสุขภาพสำหรับการวิเคราะห์การเดินและการฟื้นฟูสมรรถภาพ และโมเดลบนอุปกรณ์ที่ปกป้องความเป็นส่วนตัวโดยไม่ส่งวิดีโอไปยังคลาวด์
การใช้งานจริงในโลกแห่งความเป็นจริง
แอปฟิตเนสและโยคะที่ตรวจสอบรูปร่างของผู้ใช้และนับจำนวนครั้งจากกล้องในโทรศัพท์
การจับภาพเคลื่อนไหวแบบไม่มีเครื่องหมายสำหรับสร้างภาพเคลื่อนไหวให้กับตัวละครในภาพยนตร์และวิดีโอเกม
การวิเคราะห์กีฬาโดยวัดมุมข้อต่อ การก้าว และเทคนิคของนักกีฬา
การวิเคราะห์กายภาพบำบัดและการเดินติดตามการฟื้นตัวและคุณภาพการเคลื่อนไหวของผู้ป่วย
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Human Pose Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การประมาณความลึกตาข้างเดียว
คำถามที่พบบ่อย
What is Human Pose Estimation?
การประมาณท่าทางของมนุษย์จะตรวจจับตำแหน่งของข้อต่อต่างๆ ของร่างกาย เช่น ข้อศอก เข่า และไหล่ เพื่อสร้างโครงกระดูกดิจิทัลของบุคคลจากรูปภาพหรือวิดีโอ โดยจะเปลี่ยนพิกเซลดิบให้เป็นข้อมูลที่มีโครงสร้างเกี่ยวกับการเคลื่อนไหวของผู้คน
การประมาณท่าทางของมนุษย์ตรวจพบอะไรเป็นหลัก
การประมาณท่าทางจะค้นหาจุดสำคัญของร่างกาย เช่น ข้อศอก เข่า และไหล่ จากนั้นเชื่อมโยงเข้ากับโครงกระดูก
วิธีการประมาณค่าจากบนลงล่างทำงานอย่างไร
วิธีจากบนลงล่างจะตรวจจับแต่ละคนด้วย Bounding Box จากนั้นจึงประเมินข้อต่อภายในนั้น ซึ่งแม่นยำแต่จะช้าลงในหลายๆ คน
แบบจำลองท่าทางที่แม่นยำที่สุดทำนายอะไรสำหรับแต่ละข้อต่อแทนที่จะเป็นพิกัดดิบ
โดยทั่วไปแบบจำลองจะแสดงแผนที่ความร้อนต่อข้อต่อซึ่งมีพิกเซลที่สว่างที่สุดระบุตำแหน่งข้อต่อที่เป็นไปได้มากที่สุด ซึ่งจะฝึกความเสถียรมากกว่าการถดถอยโดยตรง
Part Affinity Fields ที่ OpenPose ใช้ช่วยอะไรบ้าง
ฟิลด์ความสัมพันธ์ของชิ้นส่วนเข้ารหัสทิศทางของแขนขาเป็นแผนที่เวกเตอร์ ช่วยให้วิธีการจากล่างขึ้นบนเชื่อมต่อจุดสำคัญได้อย่างถูกต้องแม้ว่าผู้คนจะทับซ้อนกันก็ตาม
เหตุใดวิธีการจากล่างขึ้นบนเช่น OpenPose จึงปรับขนาดได้ดีกว่าในฉากที่มีผู้คนหนาแน่น
วิธีการจากล่างขึ้นบนจะตรวจจับทุกจุดสำคัญในภาพในการผ่านครั้งเดียว จากนั้นจึงจัดกลุ่มจุดเหล่านั้น ดังนั้นต้นทุนจึงไม่เพิ่มขึ้นตามจำนวนบุคคลเพิ่มเติมแต่ละคน