คู่มือ AI แบบเห็นภาพ

การรับรู้การกระทำ

การจดจำการกระทำเป็นหน้าที่ในการสอนคอมพิวเตอร์ให้ระบุสิ่งที่ผู้คนหรือวัตถุ *กำลังทำ* ในวิดีโอ — วิ่ง โบกมือ ล้ม หรือเปิดประตู ไม่ใช่แค่สิ่งที่ปรากฏในเฟรมเดียว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because understanding motion over time unlocks applications from sports analytics to elderly fall detection.

เจาะลึก

การจดจำการกระทำเป็นมากกว่าการจัดหมวดหมู่ภาพนิ่งด้วยการให้เหตุผลว่าพิกเซลเปลี่ยนแปลงไปตามกาลเวลาอย่างไร เฟรมเดียวอาจแสดงภาพบุคคลอยู่กลางอากาศ เพียงลำดับเท่านั้นที่เผยให้เห็นว่าพวกเขากำลังกระโดด ล้ม หรือดำน้ำ คุณสมบัติการเคลื่อนไหวที่สร้างขึ้นด้วยมือของระบบในยุคแรกๆ เช่น การไหลของแสงและวิถีที่หนาแน่น วิธีการสมัยใหม่ใช้เครือข่ายเชิงลึก: สถาปัตยกรรมสองสตรีมจะประมวลผลลักษณะที่ปรากฏ (เฟรม RGB) และการเคลื่อนไหว (การไหลของแสง) แยกจากกัน เครือข่ายแบบหมุนวน 3 มิติ (เช่น C3D และ I3D) เลื่อนตัวกรองผ่านอวกาศ *และเวลา* และตัวแปลงวิดีโอ (TimeSformer, VideoMAE) ให้ความสำคัญกับแพทช์เชิงพื้นที่และชั่วคราว เกณฑ์มาตรฐาน ได้แก่ Kinetics (คลาสการกระทำของมนุษย์ 700 คลาสจาก YouTube), UCF101 และ Something-Something ซึ่งบังคับให้โมเดลเข้าใจทิศทางชั่วคราวมากกว่าแค่บริบทของฉาก

ข้อมูลเชิงลึกทางเทคนิค

ความท้าทายหลักคือการสร้างแบบจำลองมิติทางโลก การบิดแบบ 3 มิติจะขยายตัวกรอง 2 มิติปกติด้วยแกนความลึกซึ่งครอบคลุมหลายเฟรม ดังนั้นจึงเรียนรู้รูปแบบการเคลื่อนไหวได้โดยตรง เคล็ดลับ I3D 'ขยาย' น้ำหนักจากเครือข่ายภาพ 2D ที่ได้รับการฝึกฝนบน ImageNet ให้เป็น 3D โดยการจำลองน้ำหนักเหล่านั้นในช่วงเวลาหนึ่ง ทำให้เกิดจุดเริ่มต้นที่ชัดเจน วิธีสองสตรีมแทนการป้อนการไหลของแสงที่คำนวณล่วงหน้าไปยังสาขาที่แยกจากกัน เข้ารหัสการเคลื่อนไหวอย่างชัดเจน จากนั้นจึงหลอมรวมเข้ากับคุณลักษณะลักษณะที่ปรากฏ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการรับรู้การกระทำ

สาขานี้กำลังเปลี่ยนไปใช้ตัวแปลงวิดีโอที่มีประสิทธิภาพและการฝึกอบรมล่วงหน้าแบบมีผู้ดูแลด้วยตนเอง (การสร้างแบบจำลองวิดีโอแบบสวมหน้ากาก) ที่เรียนรู้จากฟุตเทจที่ไม่มีป้ายกำกับ ลดการพึ่งพาคำอธิบายประกอบที่มีราคาแพง คาดหวังการบูรณาการที่เข้มงวดยิ่งขึ้นกับโมเดลภาษาหลากรูปแบบ ดังนั้นระบบไม่เพียงแต่สามารถติดป้ายกำกับการดำเนินการ แต่ยังอธิบายและให้เหตุผลเกี่ยวกับสิ่งเหล่านั้นในภาษาธรรมชาติ การจดจำแบบเรียลไทม์บนอุปกรณ์สำหรับอุปกรณ์สวมใส่ หุ่นยนต์ และกล้องอัจฉริยะเป็นขอบเขตที่สำคัญ ควบคู่ไปกับการจดจำแบบละเอียดที่แยกแยะการเคลื่อนไหวที่ละเอียดอ่อนและใกล้เคียงกัน

การใช้งานจริงในโลกแห่งความเป็นจริง

ระบบตรวจจับการล้มในสถานดูแลผู้สูงอายุที่แจ้งเตือนเจ้าหน้าที่เมื่อผู้พักอาศัยล้มลง แยกการล้ม จากการนั่งหรือนอน

แพลตฟอร์มการวิเคราะห์กีฬาที่แท็กการเสิร์ฟ การแย่งบอล และการยิงประตูโดยอัตโนมัติในฟุตเทจการแข่งขันสำหรับไฮไลท์การฝึกสอนและการออกอากาศ

การเฝ้าระวังและการตรวจสอบความปลอดภัยที่ทำเครื่องหมายพฤติกรรมที่ผิดปกติ เช่น การต่อสู้ การเที่ยวเตร่ หรือมีคนปีนรั้ว

อินเทอร์เฟซที่ควบคุมด้วยท่าทางและแอปฟิตเนสที่นับจำนวนครั้งและตรวจสอบแบบฟอร์มการออกกำลังกายโดยจดจำการเคลื่อนไหวของร่างกายเมื่อเวลาผ่านไป

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Action Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Action Recognition?

การจดจำการกระทำเป็นหน้าที่ในการสอนคอมพิวเตอร์ให้ระบุสิ่งที่ผู้คนหรือวัตถุ *กำลังทำ* ในวิดีโอ — วิ่ง โบกมือ ล้ม หรือเปิดประตู ไม่ใช่แค่สิ่งที่ปรากฏในเฟรมเดียว สิ่งสำคัญเนื่องจากการทำความเข้าใจการเคลื่อนไหวในช่วงเวลาหนึ่งจะปลดล็อกแอปพลิเคชันตั้งแต่การวิเคราะห์กีฬาไปจนถึงการตรวจจับการล้มของผู้สูงอายุ

อะไรที่ทำให้การรู้จำการกระทำแตกต่างจากการจำแนกภาพทั่วไปโดยพื้นฐาน?

โมเดลการจดจำการกระทำจะเคลื่อนไหวตามลำดับของเฟรม เนื่องจากภาพนิ่งเดียวมักจะไม่สามารถบอกได้ว่ามีคนกระโดด ล้ม หรือดำน้ำ

ในเครือข่ายการจดจำการกระทำแบบสองสตรีมแบบคลาสสิก โดยทั่วไปแล้วสตรีมที่สองจะประมวลผลอะไร

สถาปัตยกรรมแบบสองสตรีมใช้หนึ่งสาขาสำหรับลักษณะที่ปรากฏ (เฟรม RGB) และสาขาที่สองสำหรับโฟลว์แสง ซึ่งเข้ารหัสการเคลื่อนไหวระหว่างเฟรมอย่างชัดเจน

การบิดแบบ 3D จะเพิ่มอะไรเมื่อเปรียบเทียบกับการบิดแบบ 2D มาตรฐาน

การบิดแบบ 3 มิติจะขยายตัวกรองด้วยมิติความลึก/เวลา ทำให้สามารถเรียนรู้รูปแบบการเคลื่อนไหวโดยตรงในเฟรมที่ต่อเนื่องกัน

เคล็ดลับ 'อัตราเงินเฟ้อ' ที่ใช้โดยโมเดล I3D คืออะไร

I3D 'ขยาย' ตุ้มน้ำหนักที่ฝึกไว้ในภาพ 2D (เช่น ImageNet) ให้เป็น 3D โดยการคัดลอกน้ำหนักเหล่านั้นไปตามแกนขมับ ทำให้เกิดการเริ่มต้นที่ชัดเจน

เหตุใดชุดข้อมูล Something-Something จึงมีความโดดเด่นในด้านการรับรู้การกระทำ

Something-Something ได้รับการออกแบบเพื่อให้การกระทำขึ้นอยู่กับลำดับและการเคลื่อนไหวชั่วคราว เพื่อป้องกันไม่ให้โมเดลโกงโดยใช้พื้นหลังหรือรูปลักษณ์ของวัตถุเพียงอย่างเดียว