คู่มือ AI แบบเห็นภาพ

การโน้มน้าวใจที่เปลี่ยนรูปได้

การบิดงอที่เปลี่ยนรูปได้ทำให้โครงข่ายประสาทเทียมโค้งงอตารางสุ่มตัวอย่างเพื่อให้เป็นไปตามรูปร่างที่แท้จริงของวัตถุ แทนที่จะบังคับผ่านหน้าต่างสี่เหลี่ยมที่แข็งแรง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This makes models far better at handling odd shapes, scale changes, and geometric distortion.

เจาะลึก

ตัวอย่างพิกเซลแบบหมุนปกติที่ออฟเซ็ตคงที่ — ตาราง 3x3 ที่เป็นระเบียบเรียบร้อยซึ่งมีศูนย์กลางอยู่ที่แต่ละตำแหน่ง ซึ่งใช้ได้ดีกับพื้นผิว แต่จะมีปัญหาเมื่อวัตถุเอียง ยืดออก หรือมีรูปร่างผิดปกติ การบิดงอที่เปลี่ยนรูปได้ แนะนำโดย Dai และเพื่อนร่วมงานที่ Microsoft การวิจัยในปี 2017 เพิ่มค่าชดเชยการเรียนรู้เล็กน้อยให้กับจุดสุ่มตัวอย่างแต่ละจุด เครือข่ายจะดูอินพุตและคาดการณ์การเปลี่ยนแปลง 2D สำหรับทุกตำแหน่งของกริด ดังนั้นฟิลด์รับสัญญาณจึงสามารถบิดเบี้ยวเพื่อโอบขอบโค้งหรือตามแขนขาที่เอียงได้ การรวม RoI ที่ปรับเปลี่ยนได้จะใช้แนวคิดเดียวกันกับคุณลักษณะของภูมิภาค เวอร์ชัน 2 (2018) เพิ่มน้ำหนักมอดูเลตต่อจุด เพื่อให้เลเยอร์รองรับหรือขยายแต่ละตัวอย่าง ซึ่งเพิ่มความแม่นยำในการตรวจจับวัตถุบนเกณฑ์มาตรฐาน เช่น COCO

ข้อมูลเชิงลึกทางเทคนิค

ออฟเซ็ตถูกสร้างขึ้นโดยเลเยอร์ Convolution พิเศษที่ทำงานแบบขนาน โดยส่งออกค่า 2N สำหรับเคอร์เนล N-point (หนึ่ง dx, หนึ่ง dy ต่อจุด) เนื่องจากออฟเซ็ตที่คาดการณ์ไว้นั้นเป็นเศษส่วน ค่าพิกเซลตัวอย่างจึงถูกคำนวณด้วยการแก้ไขแบบไบลิเนียร์ ซึ่งทำให้การดำเนินการทั้งหมดสามารถหาความแตกต่างได้ การออฟเซ็ตจะเรียนรู้ตั้งแต่ต้นจนจบผ่านการเผยแพร่ย้อนกลับแบบปกติ — ไม่มีการควบคุมแยกที่แยกจากกันเพื่อบอกเครือข่ายว่าจะดูจากที่ใด ต้นทุนเพิ่มเติมนั้นค่อนข้างเจียมเนื้อเจียมตัวเนื่องจากสาขาออฟเซ็ตมีน้ำหนักเบาเมื่อเทียบกับแผนผังคุณสมบัติหลัก

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการบิดเบี้ยวที่เปลี่ยนรูปได้

ความสนใจที่เปลี่ยนรูปได้กลายมาเป็นแกนหลักของการตรวจจับสมัยใหม่: DETR ที่เปลี่ยนรูปได้ใช้การชดเชยการสุ่มตัวอย่างที่เรียนรู้เพื่อทำให้ความสนใจของหม้อแปลงเบาบางและรวดเร็ว ซึ่งช่วยลดเวลาการฝึกอบรมได้อย่างมากเมื่อเทียบกับ DETR ดั้งเดิม คาดว่าหลักการที่เปลี่ยนรูปได้จะแพร่กระจายไปยังวิดีโอ, คลาวด์พอยต์ 3 มิติ และโมเดลภาษาการมองเห็น ซึ่งการสุ่มตัวอย่างแบบปรับได้จะช่วยจัดการกับการเคลื่อนไหว การบดเคี้ยว และเรขาคณิตที่ผิดปกติ เนื่องจากการสนับสนุนฮาร์ดแวร์สำหรับการเข้าถึงหน่วยความจำที่ผิดปกติได้รับการปรับปรุง ผู้ปฏิบัติงานที่ปรับเปลี่ยนรูปแบบได้ก็ควรมีราคาถูกลงและมีการนำไปใช้งานบนอุปกรณ์ Edge อย่างกว้างขวางมากขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

การตรวจจับวัตถุบน COCO โดยที่เลเยอร์ที่เปลี่ยนรูปได้จะเพิ่มความแม่นยำให้กับวัตถุที่ยาวหรือหมุนได้ เช่น รถไฟและยีราฟ

การแบ่งส่วนความหมายของฉากถนน ช่วยให้โมเดลติดตามเครื่องหมายโค้งของเลนและโครงร่างอาคารที่ไม่ปกติ

DETR ที่เปลี่ยนรูปได้สำหรับการตรวจจับจากต้นทางถึงปลายทาง โดยใช้ออฟเซ็ตที่เรียนรู้เพื่อทำให้ความสนใจของหม้อแปลงมีประสิทธิภาพ

การถ่ายภาพทางการแพทย์ ซึ่งเนื้องอกและอวัยวะมีรูปร่างที่ไม่แข็งจนทำให้เส้นกริดคงที่จับได้ไม่ดี

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deformable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

Convolution ที่แยกส่วนลึกได้

คำถามที่พบบ่อย

What is Deformable Convolutions?

การบิดงอที่เปลี่ยนรูปได้ทำให้โครงข่ายประสาทเทียมโค้งงอตารางสุ่มตัวอย่างเพื่อให้เป็นไปตามรูปร่างที่แท้จริงของวัตถุ แทนที่จะบังคับผ่านหน้าต่างสี่เหลี่ยมที่แข็งแรง สิ่งนี้ทำให้โมเดลจัดการรูปร่างแปลก ๆ การเปลี่ยนแปลงขนาด และการบิดเบี้ยวทางเรขาคณิตได้ดีขึ้นมาก

การบิดที่เปลี่ยนรูปได้จะเพิ่มอะไรเมื่อเปรียบเทียบกับการบิดแบบมาตรฐาน

การบิดงอที่เปลี่ยนรูปได้ทำนายออฟเซ็ตที่เรียนรู้ (dx, dy) สำหรับแต่ละตำแหน่งการสุ่มตัวอย่าง ปล่อยให้กริดบิดเบี้ยวเพื่อให้ตรงกับรูปร่างของวัตถุ

การสุ่มตัวอย่างจะชดเชยการบิดงอที่เปลี่ยนรูปได้อย่างไร

สาขาการบิดแบบขนานจะส่งเอาท์พุตออฟเซ็ตซึ่งเรียนรู้จากต้นทางถึงปลายทางผ่านการเผยแพร่ย้อนกลับ

เนื่องจากออฟเซ็ตที่คาดการณ์ไว้มักจะเป็นเศษส่วน ค่าพิกเซลจะถูกสุ่มตัวอย่างที่ตำแหน่งเหล่านั้นอย่างไร

การชดเชยแบบเศษส่วนจำเป็นต้องมีการประมาณค่าแบบไบลิเนียร์ ซึ่งช่วยให้การดำเนินการสร้างความแตกต่างได้สำหรับการฝึก

Deformable ConvNets v2 (2018) เพิ่มอะไรจากต้นฉบับ

v2 นำเสนอการปรับ ซึ่งเป็นน้ำหนักที่เรียนรู้ต่อจุดสุ่มตัวอย่างที่สามารถขยายหรือระงับอิทธิพลของมันได้ และปรับปรุงความแม่นยำ

เหตุใดการบิดงอที่เปลี่ยนรูปได้จึงมีประโยชน์เป็นพิเศษกับวัตถุที่มีรูปร่างไม่ปกติ

ด้วยการดัดตารางการสุ่มตัวอย่าง สนามรับสัญญาณที่มีประสิทธิภาพจะจัดแนวตามเรขาคณิตของวัตถุแทนที่จะเป็นสี่เหลี่ยมจัตุรัสแบบแข็ง