คู่มือ AI แบบเห็นภาพ

การติดตามหลายวัตถุ

การติดตามวัตถุหลายชิ้น (MOT) ติดตามวัตถุต่างๆ เช่น คนเดินถนน รถยนต์ ผู้เล่น ทั่วทั้งเฟรมของวิดีโอ ทำให้แต่ละวัตถุมีอัตลักษณ์ที่สอดคล้องกันเมื่อเวลาผ่านไป

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It's the backbone of autonomous driving perception, sports analytics, and smart-city traffic monitoring.

เจาะลึก

คำตอบการติดตามหลายวัตถุไม่ใช่แค่ 'สิ่งที่อยู่ในแต่ละเฟรม' แต่ 'การตรวจจับใดในเฟรมที่สองเป็นวัตถุเดียวกันกับในเฟรมที่หนึ่ง' รูปแบบหลักคือการติดตามโดยการตรวจจับ: ตัวตรวจจับวัตถุ (เช่น YOLO) ค้นหากล่องที่มีขอบเขตในแต่ละเฟรม จากนั้นตัวติดตามจะเชื่อมโยงกล่องเหล่านั้นข้ามเวลาไปยังวิถี SORT จับคู่ตัวกรองคาลมาน ซึ่งจะคาดการณ์ว่าแต่ละวัตถุจะเคลื่อนที่ไปที่ใด ด้วยอัลกอริธึมภาษาฮังการีเพื่อการจับคู่กล่องที่เหมาะสมที่สุด DeepSORT เพิ่มลักษณะการเรียนรู้ที่ฝังไว้ เพื่อให้สามารถระบุวัตถุได้อีกครั้งหลังจากการบดบัง ByteTrack ปรับปรุงความแม่นยำด้วยการเชื่อมโยงการตรวจจับที่มีความมั่นใจต่ำแทนที่จะละทิ้งไป ปัญหาหลักคือการบดบัง การเปลี่ยนข้อมูลระบุตัวตน (การสลับ ID เมื่อวัตถุข้าม) ฉากที่แออัด และวัตถุที่เข้าหรือออกจากเฟรม

ข้อมูลเชิงลึกทางเทคนิค

ตัวติดตามจะรักษา 'แทร็ก' สำหรับแต่ละวัตถุด้วยโมเดลการเคลื่อนไหว ตัวกรองคาลมานทำนายตำแหน่งถัดไปของแต่ละแทร็ก การตรวจจับใหม่จะจับคู่กับการคาดการณ์โดยการคำนวณต้นทุน (การทับซ้อน/IoU บวกกับความคล้ายคลึงกันของรูปลักษณ์) และการแก้ปัญหาการกำหนดด้วยอัลกอริธึมภาษาฮังการี การฝังลักษณะที่ปรากฏ — เวกเตอร์ฟีเจอร์ขนาดกะทัดรัดจากเครือข่ายการระบุตัวตนใหม่ — ช่วยให้ระบบกู้คืนข้อมูลระบุตัวตนที่ถูกต้องหลังจากที่วัตถุถูกซ่อนไว้ชั่วคราว เพื่อป้องกันไม่ให้สวิตช์ ID ที่โมเดลการเคลื่อนไหวล้วนต้องประสบในฉากที่แออัด

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการติดตามหลายวัตถุ

การติดตามกำลังเคลื่อนไปสู่โมเดลหม้อแปลงแบบ end-to-end (เช่น TrackFormer และ MOTR) ที่ร่วมกันตรวจจับและเชื่อมโยงวัตถุในเครือข่ายเดียว โดยลบขั้นตอนการจับคู่ที่ปรับแต่งด้วยมือที่เปราะบางออกไป คาดว่าจะมีการติดตามด้วยกล้องหลายตัวและ 3 มิติที่แข็งแกร่งยิ่งขึ้นสำหรับยานยนต์ไร้คนขับและสถานที่ขนาดใหญ่ รวมถึงการติดตามวัตถุที่เป็นคำศัพท์แบบเปิดตามอำเภอใจ แทนที่จะเป็นหมวดหมู่ที่ตายตัว การระบุตัวตนใหม่ในระยะยาวที่ดีขึ้นและความทนทานต่อการบดบังการบดบังอย่างหนักและฝูงชนยังคงเป็นเป้าหมายที่กระตือรือร้น โดยได้รับความช่วยเหลือมากขึ้นจากแบบจำลองพื้นฐานที่ให้คุณสมบัติด้านภาพที่หลากหลาย

การใช้งานจริงในโลกแห่งความเป็นจริง

การรับรู้ยานพาหนะอัตโนมัติที่ติดตามรถยนต์ รอบข้าง นักปั่นจักรยาน และคนเดินถนน เพื่อคาดเดาเส้นทางและหลีกเลี่ยงการชน

การวิเคราะห์กีฬาที่ติดตามผู้เล่นทุกคนและลูกบอลเพื่อคำนวณระยะทางที่ครอบคลุม รูปแบบการเล่น และสถิติการครองบอล

ระบบการจราจรในเมืองอัจฉริยะที่นับและติดตามยานพาหนะเพื่อวัดการไหล ตรวจจับความแออัด และสัญญาณเวลา

การวิเคราะห์การค้าปลีกและความปลอดภัยที่ติดตามการเคลื่อนไหวของผู้ซื้อผ่านร้านค้าหรือผู้คนผ่านศูนย์กลางการขนส่งสาธารณะ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Object Tracking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การตรวจจับวัตถุ

คำถามที่พบบ่อย

What is Multi-Object Tracking?

การติดตามวัตถุหลายชิ้น (MOT) ติดตามวัตถุต่างๆ เช่น คนเดินถนน รถยนต์ ผู้เล่น ทั่วทั้งเฟรมของวิดีโอ ทำให้แต่ละวัตถุมีอัตลักษณ์ที่สอดคล้องกันเมื่อเวลาผ่านไป เป็นหัวใจหลักของการรับรู้การขับขี่อัตโนมัติ การวิเคราะห์กีฬา และการติดตามการจราจรในเมืองอัจฉริยะ

เป้าหมายหลักของการติดตามหลายวัตถุคืออะไร

MOT กำหนดและรักษา ID ที่สอดคล้องกันสำหรับแต่ละวัตถุในขณะที่เคลื่อนที่ผ่านวิดีโอ โดยเชื่อมโยงการตรวจจับเมื่อเวลาผ่านไปเข้ากับวิถี

กระบวนทัศน์ 'การติดตามโดยการตรวจจับ' เกี่ยวข้องกับอะไร

การติดตามโดยการตรวจจับจะเรียกใช้ตัวตรวจจับวัตถุแต่ละเฟรม จากนั้นเชื่อมโยงกล่องผลลัพธ์ในช่วงเวลาหนึ่งเข้ากับแทร็กที่ต่อเนื่องกัน

ตัวกรองคาลมานมีบทบาทอย่างไรในตัวติดตามเช่น SORT

ตัวกรองคาลมานจำลองการเคลื่อนที่ของวัตถุแต่ละชิ้นและคาดการณ์ตำแหน่งถัดไป ซึ่งจากนั้นจะจับคู่กับการตรวจจับใหม่

DeepSORT เพิ่มอะไรไว้ด้านบนของ SORT

DeepSORT เปิดตัวเวกเตอร์คุณลักษณะลักษณะที่ปรากฏ เพื่อให้สามารถระบุวัตถุได้อีกครั้งหลังจากถูกซ่อนไว้ชั่วคราว ซึ่งช่วยลดการสลับข้อมูลระบุตัวตน

'สวิตช์ข้อมูลประจำตัว' ในการติดตามหลายวัตถุคืออะไร

สวิตช์การระบุตัวตนเกิดขึ้นเมื่อตัวติดตามกำหนด ID ใหม่ระหว่างวัตถุอย่างไม่ถูกต้อง โดยทั่วไปเมื่อวัตถุเหล่านั้นทับซ้อนกันหรือข้ามในฉากที่มีผู้คนหนาแน่น