คู่มือ AI แบบเห็นภาพ

สเตอริโอหลายมุมมอง

Multi-View Stereo (MVS) ถ่ายภาพฉากที่ได้รับการปรับเทียบแล้วจำนวนมาก และสร้างโครงสร้าง 3 มิติที่หนาแน่นขึ้นใหม่โดยการประมาณความลึกที่เกือบทุกพิกเซล

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It turns the sparse skeleton from Structure from Motion into detailed, surface-rich 3D models.

เจาะลึก

MVS ถือว่าท่ากล้องเป็นที่รู้จักอยู่แล้ว (โดยทั่วไปมาจากโครงสร้างจากการเคลื่อนไหว) และมุ่งเน้นไปที่การกู้คืนรูปทรงเรขาคณิตที่หนาแน่น หลักการสำคัญคือความสม่ำเสมอของภาพถ่าย: จุดพื้นผิว 3 มิติที่ประมาณไว้อย่างถูกต้องควรมีลักษณะเหมือนกันเมื่อฉายภาพหลายภาพที่เห็น อัลกอริธึมจะทดสอบความลึกของผู้สมัครสำหรับแต่ละพิกเซล และเลือกความลึกที่ลักษณะที่ปรากฏข้ามมุมมองสอดคล้องกันมากที่สุด มักใช้ระบบสเตอริโอแบบกวาดระนาบหรือการจับคู่แบบแพตช์ (เช่นในวิธี PMVS แบบคลาสสิก) จากนั้นแผนที่เชิงลึกต่อภาพจะถูกหลอมรวมเข้ากับพอยต์คลาวด์หรือเมชแบบรวม เพื่อแก้ไขข้อขัดแย้งและกรองค่าผิดปกติ การจัดการกับสิ่งกีดขวาง ผนังที่ไม่มีพื้นผิว และพื้นผิวสะท้อนแสงคือปัญหาหลัก เครือข่าย MVS ที่เน้นการเรียนรู้ เช่น MVSNet ในขณะนี้สร้างปริมาณต้นทุนและปรับให้เป็นมาตรฐานด้วยการบิดแบบ 3 มิติเพื่อความแข็งแกร่งที่มากขึ้น

ข้อมูลเชิงลึกทางเทคนิค

ความสม่ำเสมอของภาพถ่ายเป็นสัญญาณชี้นำ: สำหรับความลึกที่ตั้งสมมุติฐาน MVS จะบิดแพตภาพจากมุมมองข้างเคียงไปยังมุมมองอ้างอิง และวัดว่าพวกเขาเห็นด้วยได้ดีเพียงใด โดยมักจะมีความสัมพันธ์ข้ามแบบปกติ สเตอริโอ Plane-sweep ทำให้สิ่งนี้เป็นระเบียบเรียบร้อยโดยการกวาดระนาบเสมือนผ่านความลึก คำนวณต้นทุนที่ตรงกันในแต่ละเลเยอร์ และเลือกความลึกที่มีความเห็นพ้องต้องกันมากที่สุด ในขณะเดียวกันก็ลงโทษพื้นที่ที่ถูกแยกออกหรือมีพื้นผิวต่ำ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของสเตอริโอหลายมุมมอง

การเรียนรู้เชิงลึกกำลังเปลี่ยนโฉม MVS: เครือข่ายอย่าง MVSNet และผู้สืบทอดเรียนรู้การจับคู่ต้นทุนและการปรับความลึกให้เป็นมาตรฐานตั้งแต่ต้นทางถึงปลายทาง การจัดการพื้นผิวที่อ่อนแอและพื้นผิวสะท้อนแสงได้ดีกว่าวิธีการปรับแต่งด้วยมือ สนามนี้ยังมาบรรจบกันด้วยการเรนเดอร์แบบนิวรัล โดย Gaussian Splatting และ NeRF นำเสนอทางเลือกใหม่ที่มีความหนาแน่นสูง โดยผลักดัน MVS ไปสู่ความเที่ยงตรงที่สูงขึ้น รันไทม์ที่เร็วขึ้น และโมเดลที่มีความแม่นยำตามหน่วยเมตริกสำหรับ AR, หุ่นยนต์, แฝดดิจิทัล และการทำแผนที่เมือง 3 มิติขนาดใหญ่

การใช้งานจริงในโลกแห่งความเป็นจริง

สร้างตาข่าย 3 มิติที่มีรายละเอียดหนาแน่นของอาคารและทิวทัศน์จากโดรนหรือภาพถ่ายทางอากาศ

การสร้างการสแกนวัตถุและผลิตภัณฑ์ 3 มิติที่มีความเที่ยงตรงสูงสำหรับอีคอมเมิร์ซ เกม และ VR

สร้างแฝดดิจิทัลของโรงงานและสถานที่ก่อสร้างเพื่อตรวจสอบและวางแผน

การสร้างภูมิประเทศและโครงสร้างโดยละเอียดขึ้นใหม่จากคอลเลกชันภาพถ่ายดาวเทียมหรือระดับถนน

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-View Stereo quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การประมาณความลึกสเตอริโอ

คำถามที่พบบ่อย

What is Multi-View Stereo?

Multi-View Stereo (MVS) ถ่ายภาพฉากที่ได้รับการปรับเทียบแล้วจำนวนมาก และสร้างโครงสร้าง 3 มิติที่หนาแน่นขึ้นใหม่โดยการประมาณความลึกที่เกือบทุกพิกเซล มันเปลี่ยนโครงกระดูกเบาบางจากโครงสร้างจากการเคลื่อนไหวเป็นโมเดล 3 มิติที่มีรายละเอียดและสมบูรณ์บนพื้นผิว

โดยทั่วไป Multi-View Stereo ถือว่าอะไรเป็นที่รู้จักแล้วก่อนที่จะเริ่ม?

MVS อาศัยตำแหน่งกล้องที่ปรับเทียบแล้ว ซึ่งโดยปกติแล้วจะมาจากโครงสร้างจากการเคลื่อนไหว และมุ่งเน้นไปที่ความลึกที่หนาแน่น

MVS ใช้หลักการสำคัญใดในการค้นหาจุด 3 มิติที่ถูกต้อง

จุดพื้นผิวที่ถูกต้องควรปรากฏสม่ำเสมอเมื่อฉายลงในภาพทั้งหมดที่สังเกตเห็น

MVS แตกต่างจากผลลัพธ์ของโครงสร้างจากการเคลื่อนไหวอย่างไร

SfM ให้ผลสนับสนุนที่เบาบาง MVS อัดแน่นเป็นพื้นผิวที่มีรายละเอียดครอบคลุมเกือบทุกพิกเซล

สเตอริโอแบบ Plane-sweep ทำหน้าที่อะไร?

โดยจะทดสอบความลึกของผู้สมัครจำนวนมากโดยการกวาดระนาบและคำนวณต้นทุนที่ตรงกันในแต่ละเลเยอร์

พื้นผิวใดที่ท้าทายเป็นพิเศษสำหรับ MVS

ผนังเปล่าขาดคุณสมบัติที่เข้ากันได้ และกระจก/พื้นผิวมันเงาละเมิดความสม่ำเสมอของภาพถ่าย ทำลายการจับคู่มาตรฐาน