การตรวจจับวัตถุคำศัพท์แบบเปิด
การตรวจจับวัตถุคำศัพท์แบบเปิดช่วยให้โมเดลค้นหาและกล่องวัตถุที่อธิบายด้วยข้อความที่กำหนดเอง รวมถึงหมวดหมู่ที่ไม่เคยเห็นป้ายกำกับระหว่างการฝึก
ภาพรวม
It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.
เจาะลึก
ตัวตรวจจับแบบคลาสสิกได้รับการฝึกฝนในชุดหมวดหมู่ปิด เช่น 80 คลาสใน COCO และไม่สามารถจดจำ 'สิ่ง' ที่อยู่นอกรายการนั้นได้ การตรวจจับคำศัพท์แบบเปิดนั้นจำกัดโดยการจัดตำแหน่งคุณลักษณะขอบเขตการมองเห็นให้สอดคล้องกับพื้นที่ฝังภาษาการมองเห็นที่ใช้ร่วมกัน ซึ่งโดยทั่วไปจะเรียนรู้จากคู่ข้อความรูปภาพขนาดใหญ่ (เช่นใน CLIP) ในการอนุมาน คุณระบุป้ายกำกับข้อความ โมเดลจะฝังป้ายกำกับเหล่านั้น และจะจับคู่ขอบเขตที่ตรวจพบกับข้อความใดก็ตามที่ฝังอยู่ใกล้ที่สุด ดังนั้นหมวดหมู่ใหม่จะทำงานได้ตราบเท่าที่คุณสามารถอธิบายได้ ระบบต่างๆ เช่น ViLD, GLIP, OWL-ViT, Detic และ Grounding DINO ทำให้แนวทางนี้ได้รับความนิยมโดยการรวมแบ็คโบนการตรวจจับเข้ากับการต่อสายดินของภาษา และโดยการฝึกอบรมชุดข้อมูลขนาดใหญ่ที่มีป้ายกำกับไม่ชัดเจนหรือมีการต่อสายดิน
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับคือการแทนที่เลเยอร์ลักษณนามคงที่ด้วยการฝังข้อความ แทนที่จะเรียนรู้เวกเตอร์น้ำหนักหนึ่งตัวต่อคลาสที่รู้จัก ตัวตรวจจับจะฉายภาพแต่ละภูมิภาคในพื้นที่เดียวกันกับตัวเข้ารหัสภาษา การจำแนกประเภทกลายเป็นการเปรียบเทียบความคล้ายคลึงกันระหว่างคุณลักษณะของภูมิภาคและการฝังชื่อหรือวลีหมวดหมู่ที่ผู้ใช้ระบุ เนื่องจากตัวเข้ารหัสข้อความมีลักษณะทั่วไปเป็นคำที่มองไม่เห็น การสลับสตริงป้ายกำกับใหม่ ณ เวลาทดสอบทำให้สามารถตรวจจับหมวดหมู่ที่ขาดหายไปจากข้อมูลการฝึกขอบเขตกล่อง
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการตรวจจับวัตถุคำศัพท์แบบเปิด
การตรวจจับคำศัพท์แบบเปิดกำลังมาบรรจบกันด้วยการต่อสายดินและการแบ่งส่วน โดยที่วลีรูปแบบอิสระ (ไม่ใช่แค่คำเดียว) แปลวัตถุ และด้วยระบบที่พร้อมท์เมื่อรวมกับโมเดล เช่น SAM สำหรับมาสก์ คาดหวังความแม่นยำในการยิงเป็นศูนย์ที่แข็งแกร่งขึ้น ข้อความค้นหาที่มีองค์ประกอบยาวและยาวขึ้น ('เหยือกสีแดงด้านหลังแล็ปท็อป') และการเชื่อมต่อกับผู้ช่วยหลายรูปแบบที่ตรวจจับได้ตามความต้องการ เมื่อการฝึกอบรมข้อความรูปภาพระดับเว็บดีขึ้น เส้นแบ่งระหว่างการตรวจจับ การดึงข้อมูล และความเข้าใจภาษาจะค่อยๆ พร่ามัวไปสู่การมองเห็นทั่วไป
การใช้งานจริงในโลกแห่งความเป็นจริง
ค้นหารูปภาพสำหรับวัตถุหายากหรือวัตถุแบบกำหนดเองโดยพิมพ์ชื่อโดยไม่ต้องฝึกใหม่
ระบบหุ่นยนต์ค้นหาสิ่งของด้วยชื่อผู้ใช้ในภาษาธรรมชาติก่อนที่จะหยิบจับ
ชุดข้อมูลติดป้ายกำกับอัตโนมัติโดยการตรวจจับหมวดหมู่ใหม่มากมายจากรายการข้อความ
การกลั่นกรองเนื้อหาที่ทำเครื่องหมายว่าวัตถุที่อธิบายไม่ปรากฏในป้ายกำกับการฝึกอบรมดั้งเดิม
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Open-Vocabulary Object Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การตรวจจับวัตถุ
คำถามที่พบบ่อย
What is Open-Vocabulary Object Detection?
การตรวจจับวัตถุคำศัพท์แบบเปิดช่วยให้โมเดลค้นหาและกล่องวัตถุที่อธิบายด้วยข้อความที่กำหนดเอง รวมถึงหมวดหมู่ที่ไม่เคยเห็นป้ายกำกับระหว่างการฝึก สิ่งสำคัญคือเนื่องจากตัวตรวจจับแบบเดิมถูกล็อกไว้ในรายการคลาสที่ตายตัว ในขณะที่โมเดลคำศัพท์แบบเปิดสามารถตรวจจับได้เกือบทุกอย่างที่คุณสามารถตั้งชื่อได้
ความสามารถในการกำหนดของการตรวจจับวัตถุคำศัพท์แบบเปิดคืออะไร?
การตรวจจับคำศัพท์แบบเปิดสามารถแปลหมวดหมู่ที่ระบุด้วยข้อความ ณ เวลาทดสอบ แม้แต่หมวดหมู่ที่ไม่เคยเห็นซึ่งมีป้ายกำกับด้วยกล่องขอบก็ตาม
โมเดลเหล่านี้จำแนกภูมิภาคที่ตรวจพบได้อย่างไร
พวกเขาฉายภูมิภาคลงในพื้นที่ฝังภาษาวิสัยทัศน์และจับคู่แต่ละภูมิภาคกับการฝังป้ายข้อความที่ใกล้เคียงที่สุด
ทรัพยากรการฝึกอบรมล่วงหน้าใดที่ช่วยให้สามารถตรวจจับคำศัพท์แบบเปิดได้มากที่สุด
ข้อมูลข้อความรูปภาพจำนวนมาก (ตามที่ใช้โดยโมเดลสไตล์ CLIP) สร้างพื้นที่ฝังที่ใช้ร่วมกันซึ่งช่วยให้ข้อความสามารถสรุปเป็นหมวดหมู่ใหม่ได้
ส่วนประกอบใดจะถูกแทนที่เมื่อเปรียบเทียบกับเครื่องตรวจจับแบบปิด
แทนที่จะใช้เวกเตอร์น้ำหนักคลาสคงที่ การจัดหมวดหมู่จะใช้ความคล้ายคลึงกับการฝังข้อความ ดังนั้นจึงสามารถเพิ่มสตริงป้ายกำกับใหม่ได้ในเวลาทดสอบ
ข้อใดคือตัวอย่างโมเดลการตรวจจับคำศัพท์แบบเปิดหรือแบบกราวด์
Grounding DINO พร้อมด้วย GLIP, OWL-ViT, ViLD และ Detic เป็นเครื่องตรวจจับคำศัพท์แบบเปิดหรือแบบกราวด์ที่รู้จักกันดี