การประมาณความลึกตาข้างเดียว
การประมาณความลึกด้วยตาข้างเดียวจะคาดการณ์ว่าทุกพิกเซลอยู่ห่างจากภาพถ่ายปกติเพียงภาพเดียว โดยไม่ต้องใช้กล้องสเตอริโอ ลิดาร์ หรือเซ็นเซอร์วัดความลึก
ภาพรวม
It lets one camera perceive 3D structure from a flat 2D image.
เจาะลึก
มนุษย์สามารถตัดสินความลึกจากตาข้างเดียวโดยใช้สัญญาณต่างๆ เช่น เปอร์สเปคทีฟ ขนาดสัมพัทธ์ การไล่ระดับสีของพื้นผิว การแรเงา และการบดเคี้ยว การประมาณความลึกแบบตาข้างเดียวจะสอนกลเม็ดแบบเดียวกันให้กับโครงข่ายประสาทเทียม นั่นคือ ป้อนภาพ RGB เดียวและส่งออกค่าความลึกสำหรับแต่ละพิกเซล เนื่องจากภาพ 2D มีความคลุมเครือเกี่ยวกับขนาดสัมบูรณ์ งานจึงเป็นเรื่องยาก ฉาก 3D จำนวนมากสามารถฉายภาพให้เป็นภาพเดียวกันได้ เครือข่ายเรียนรู้ข้อมูลเชิงสถิติจากชุดข้อมูลขนาดใหญ่เพื่อแก้ไขปัญหานี้ การฝึกอบรมมีสองรูปแบบ: ภายใต้การดูแล โดยใช้ความลึกจากพื้นดินจริงจากเซ็นเซอร์ LIDAR หรือ RGB-D และการควบคุมดูแลด้วยตนเอง ซึ่งเรียนรู้เชิงลึกจากคู่วิดีโอหรือสเตอริโอล้วนๆ โดยการบังคับให้ความลึกที่คาดการณ์ไว้ฉายภาพหนึ่งไปยังอีกมุมมองหนึ่งได้อย่างถูกต้อง โมเดลพื้นฐานล่าสุด เช่น MiDaS และ Depth Anything สามารถสรุปได้อย่างน่าทึ่งในฉากที่มองไม่เห็น
ข้อมูลเชิงลึกทางเทคนิค
วิธีการควบคุมตนเองใช้ประโยชน์จากเรขาคณิตแทนการใช้ฉลาก เมื่อพิจารณาสองมุมมอง (เฟรมวิดีโอสเตอริโอหรือต่อเนื่องกัน) และแผนที่เชิงลึกที่คาดการณ์ไว้บวกกับการเคลื่อนไหวของกล้อง โมเดลจะบิดเบี้ยวภาพหนึ่งเพื่อสร้างอีกภาพขึ้นมาใหม่ ข้อผิดพลาดในการสร้างใหม่ระดับพิกเซลจะกลายเป็นสัญญาณการฝึกอบรม การสูญเสีย 'การสังเคราะห์มุมมอง' นี้หมายความว่าสามารถเรียนรู้เชิงลึกได้จากวิดีโอดิบที่ไม่มีป้ายกำกับ ข้อจำกัดที่สำคัญคือความคลุมเครือของมาตราส่วน: ความลึกของตาข้างเดียวมักจะถูกต้องจนถึงตัวคูณที่ไม่รู้จักเท่านั้น เว้นแต่จะมีการปรับเทียบกับการอ้างอิงที่ทราบหรือการควบคุมหน่วยเมตริก
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการประมาณความลึกตาข้างเดียว
โมเดลพื้นฐานเชิงลึกทั่วไปที่ได้รับการฝึกกับภาพผสมหลายล้านภาพกำลังผลักดันไปสู่ความลึกที่เชื่อถือได้แบบเมตริก (สเกลจริง) ในทุกฉาก แม้กระทั่งแบบที่ไม่เคยเห็นในการฝึกฝนก็ตาม คาดหวังการผสมผสานที่แน่นยิ่งขึ้นด้วยออปติคอลโฟลว์และ SLAM สำหรับการสร้างฉาก 3D เต็มรูปแบบ รุ่นที่เบากว่าที่ทำงานสดบนโทรศัพท์และชุดหูฟัง และความทนทานแบบ Zero-shot ที่แข็งแกร่งยิ่งขึ้น สิ่งนี้จะทำให้การรับรู้เชิงพื้นที่ที่สมบูรณ์มีราคาถูกและแพร่หลาย สามารถทำได้จากกล้องตัวเดียว แทนที่จะเป็นแท่นขุดเจาะเชิงลึกที่มีราคาแพง
การใช้งานจริงในโลกแห่งความเป็นจริง
โหมดแนวตั้งของสมาร์ทโฟนจำลองการเบลอพื้นหลัง (โบเก้) โดยการประมาณระยะห่างระหว่างวัตถุกับพื้นหลัง
แอพ Augmented Reality วางวัตถุเสมือนเพื่อให้วางอย่างถูกต้องด้านหลังเฟอร์นิเจอร์ในโลกแห่งความเป็นจริง
โดรนและหุ่นยนต์ราคาถูกหลบหลีกสิ่งกีดขวางโดยใช้กล้องหน้าตัวเดียว
การแปลงภาพถ่ายและภาพยนตร์ 2D ให้เป็น 3D โดยการอนุมานความลึกต่อพิกเซลสำหรับการแสดงผลสามมิติ
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Monocular Depth Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การประมาณความลึกสเตอริโอ
คำถามที่พบบ่อย
What is Monocular Depth Estimation?
การประมาณความลึกด้วยตาข้างเดียวจะคาดการณ์ว่าทุกพิกเซลอยู่ห่างจากภาพถ่ายปกติเพียงภาพเดียว โดยไม่ต้องใช้กล้องสเตอริโอ ลิดาร์ หรือเซ็นเซอร์วัดความลึก ช่วยให้กล้องตัวหนึ่งรับรู้โครงสร้าง 3 มิติจากภาพ 2 มิติแบบเรียบๆ
อะไรทำให้การประมาณความลึก 'ตาข้างเดียว'
'ตาข้างเดียว' หมายถึงตาข้างเดียวหรือกล้อง; วิธีการนี้จะทำนายความลึกจากภาพ RGB เดียวโดยไม่ต้องใช้เซ็นเซอร์สเตอริโอหรือเซ็นเซอร์ความลึกแบบแอคทีฟ
เหตุใดการประมาณความลึกของตาข้างเดียวจึงมีความคลุมเครือโดยพื้นฐาน
การฉายภาพ 2D ครั้งเดียวจะสูญเสียข้อมูลขนาด ดังนั้นการจัดเรียง 3D หลายรายการจึงสอดคล้องกับภาพเดียว เครือข่ายอาศัยความรู้ก่อนหน้าเพื่อชี้แจงความกำกวม
วิธีการควบคุมตัวเองจะเรียนรู้เชิงลึกโดยไม่มีป้ายกำกับความจริงได้อย่างไร
แบบจำลองจะฉายภาพหนึ่งไปยังอีกภาพหนึ่งโดยใช้ความลึกและการเคลื่อนไหวของกล้องที่คาดการณ์ไว้ ข้อผิดพลาดทางโฟโตเมตริกจะส่งสัญญาณการเรียนรู้ โดยไม่จำเป็นต้องมีป้ายกำกับ
คิวใดที่เครือข่ายตาข้างเดียวไม่พึ่งพาความลึกโดยตรง
ความไม่เท่าเทียมกันของสเตอริโอต้องใช้กล้องสองตัว วิธีการตาข้างเดียวอาศัยสัญญาณภาพเดี่ยว เช่น ขนาด เปอร์สเป็คทีฟ พื้นผิว และการบดเคี้ยว
'ความคลุมเครือของสเกล' ในระดับความลึกตาข้างเดียวคืออะไร?
หากไม่มีการควบคุมระบบเมตริกหรือการอ้างอิงที่ทราบ ความลึกของตาข้างเดียวจะให้โครงสร้างสัมพัทธ์ที่ถูกต้องแต่มีสเกลสัมบูรณ์ที่ไม่แน่นอน