คู่มือ AI แบบเห็นภาพ

วิชวลสแลม

Visual SLAM ช่วยให้กล้องที่กำลังเคลื่อนที่สร้างแผนที่ของพื้นที่ที่ไม่รู้จักในขณะเดียวกันก็ติดตามตำแหน่งของตัวเองในแผนที่นั้นไปพร้อมๆ กัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the spatial backbone of robots, drones, AR headsets, and self-driving features.

เจาะลึก

SLAM ย่อมาจาก Simultaneous Localization and Mapping และรูปแบบภาพจะแก้ปัญหาได้โดยใช้กล้องแทน (หรือด้านข้าง) ไลดาร์หรือเรดาร์ ขณะที่กล้องเคลื่อนที่ ระบบจะตรวจจับคุณสมบัติที่โดดเด่น เช่น มุมและขอบ จับคู่สิ่งเหล่านั้นในเฟรม และใช้การเคลื่อนไหวที่ชัดเจนของจุดเหล่านั้นเพื่อประเมินทั้งโครงสร้าง 3 มิติของฉากและวิถีของกล้อง ส่วนที่ยากคือการมีเพศสัมพันธ์ระหว่างไก่กับไข่ คุณต้องมีแผนที่เพื่อรู้ว่าคุณอยู่ที่ไหน แต่คุณต้องรู้ว่าอยู่ที่ไหนเพื่อสร้างแผนที่ Visual SLAM จัดการเรื่องนี้ร่วมกัน โดยมักจะปรับคะแนนหลายพันจุดและโพสท่าในคราวเดียว มันขับเคลื่อน ARKit, ARCore, การติดตามจากภายในสู่ภายนอกของ Meta Quest, รถแลนด์โรเวอร์บนดาวอังคาร และหุ่นยนต์ในโกดัง โดยทำงานในบ้านที่ GPS ใช้งานไม่ได้

ข้อมูลเชิงลึกทางเทคนิค

ไปป์ไลน์ทั่วไปมีส่วนหน้าที่ติดตามคุณลักษณะแบบเฟรมต่อเฟรม (โดยใช้ ORB, SIFT หรือวิธีไดเร็กโฟโตเมตริก) และแบ็คเอนด์ที่ปรับแผนที่ให้เหมาะสม การปรับแบบรวมกลุ่มจะช่วยลดข้อผิดพลาดในการฉายภาพซ้ำในท่ากล้องและจุด 3D จำนวนมาก ในขณะที่การปิดแบบวนซ้ำจะตรวจจับเมื่อกล้องกลับมายังสถานที่และแก้ไขการเลื่อนที่สะสม สแลมตาข้างเดียวไม่สามารถกู้คืนสเกลสัมบูรณ์ได้ ดังนั้นกล้องสเตอริโอหรือหน่วยวัดแรงเฉื่อย (IMU) จึงถูกหลอมรวมเพื่อแก้ไข

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ Visual SLAM

สาขาวิชานี้กำลังเปลี่ยนจากการจับคู่คุณสมบัติที่สร้างขึ้นด้วยมือ ไปสู่คุณสมบัติที่เรียนรู้ ความลึกที่เรียนรู้ และ SLAM แบบประสาทสัมผัสแบบ end-to-end ที่แข็งแกร่งกว่ากับผนังที่ไม่มีพื้นผิว ความเบลอของการเคลื่อนไหว และแสงที่เปลี่ยนแปลง สนามความกระจ่างใสของระบบประสาทและการสาดแบบเกาส์เซียนกำลังถูกหลอมรวมเข้ากับ SLAM เพื่อสร้างแผนที่ที่หนาแน่นและสมจริงมากกว่าที่จะเป็นเมฆจุดกระจัดกระจาย คาดหวังการผสมผสานระหว่างภาพและเฉื่อยที่แน่นยิ่งขึ้นบนโทรศัพท์และชุดหูฟัง รวมถึง SLAM ความหมายที่ติดป้ายกำกับวัตถุ ช่วยให้หุ่นยนต์สามารถให้เหตุผลเกี่ยวกับฉาก ไม่ใช่แค่นำทางรูปทรงเรขาคณิตเท่านั้น

การใช้งานจริงในโลกแห่งความเป็นจริง

การติดตามตำแหน่งจากภายในสู่ภายนอกบน Meta Quest และชุดหูฟัง Apple Vision Pro โดยระบุตำแหน่งผู้ใช้ในห้องที่ไม่มีสถานีฐานภายนอก

Apple ARKit และ Google ARCore ยึดเฟอร์นิเจอร์เสมือนจริงหรือตัวละครในเกมเข้ากับพื้นและโต๊ะจริงบนโทรศัพท์

รถแลนด์โรเวอร์ดาวอังคารของ NASA ใช้การวัดระยะทางและการทำแผนที่เพื่อนำทางภูมิประเทศที่ไม่มี GPS

หุ่นยนต์คลังสินค้าอัตโนมัติและหุ่นยนต์จัดส่งภายในอาคารสร้างแผนผังพื้นและระบุตำแหน่งระหว่างชั้นวาง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การใช้เหตุผลทางสายตา

คำถามที่พบบ่อย

What is Visual SLAM?

Visual SLAM ช่วยให้กล้องที่กำลังเคลื่อนที่สร้างแผนที่ของพื้นที่ที่ไม่รู้จักในขณะเดียวกันก็ติดตามตำแหน่งของตัวเองในแผนที่นั้นไปพร้อมๆ กัน โดยเป็นกระดูกสันหลังเชิงพื้นที่ของหุ่นยนต์ โดรน อุปกรณ์สวมศีรษะ AR และคุณสมบัติการขับขี่ด้วยตนเอง

สแลม ย่อมาจากอะไร?

SLAM หมายถึงการแปลและการทำแผนที่พร้อมกัน: การสร้างแผนที่พร้อมกับค้นหาตำแหน่งของคุณในเวลาเดียวกัน

เหตุใด Visual SLAM แบบตาข้างเดียว (กล้องเดี่ยว) จึงไม่สามารถกู้คืนขนาดสัมบูรณ์ได้ด้วยตัวเอง

ด้วยกล้องตัวเดียวและไม่มีคิวอื่น ฉากเล็กๆ ในบริเวณใกล้เคียงและฉากระยะไกลขนาดใหญ่จึงสามารถดูเหมือนกันได้ ดังนั้นมาตราส่วนเมตริกที่แท้จริงจึงไม่ชัดเจนหากไม่มีสเตอริโอหรือ IMU

จุดประสงค์ของการปิดลูปในระบบ SLAM คืออะไร?

ข้อผิดพลาดในการติดตามเล็กๆ น้อยๆ สะสมเมื่อเวลาผ่านไปตามความคลาดเคลื่อน การตรวจจับว่ากล้องได้กลับไปยังจุดที่ทราบแล้วจะทำให้ระบบแก้ไขวิถีทั้งหมดได้

การปรับบันเดิลเพิ่มประสิทธิภาพอะไรในแบ็กเอนด์ SLAM

การปรับแบบรวมกลุ่มจะร่วมกันปรับแต่งตำแหน่งกล้องและจุดบนแผนที่เพื่อให้จุด 3D ที่ฉายไว้ตรงกับตำแหน่งที่ปรากฏในภาพจริงที่สุด

เหตุใด IMU (หน่วยวัดแรงเฉื่อย) จึงมักถูกรวมเข้ากับกล้องใน Visual SLAM

มาตรความเร่งและไจโรสโคปให้การประมาณการเคลื่อนไหวที่ทำให้การติดตามมีความเสถียรผ่านภาพเบลอจากการเคลื่อนไหว และช่วยแก้ไขขนาด ซึ่งกล้องตัวเดียวไม่สามารถทำได้