DUSt3R การสร้างใหม่ 3 มิติหนาแน่น
DUSt3R สร้างรูปทรงเรขาคณิต 3 มิติที่มีความหนาแน่นสูงขึ้นมาใหม่จากภาพถ่ายธรรมดาจำนวนหนึ่งโดยไม่จำเป็นต้องทราบตำแหน่งกล้องหรือการสอบเทียบ
ภาพรวม
It collapses the traditional multi-step photogrammetry pipeline into a single neural network that just outputs 3D points.
เจาะลึก
การสร้าง 3D แบบคลาสสิกขึ้นใหม่ (โครงสร้างจากการเคลื่อนไหวบวกกับสเตอริโอหลายมุมมอง) เป็นห่วงโซ่ที่เปราะบาง: ตรวจจับคุณสมบัติ จับคู่มัน ประมาณท่าทางของกล้อง สามเหลี่ยม แล้วเพิ่มความหนาแน่น แต่ละขั้นตอนอาจล้มเหลวได้ และโดยปกติคุณจะต้องมีภาพที่ทับซ้อนกันจำนวนมากและทราบข้อมูลภายในของกล้อง DUSt3R (Wang et al., 2024) กำหนดกรอบปัญหาใหม่ทั้งหมด ด้วยภาพเพียงสองภาพ เครือข่ายที่ใช้หม้อแปลงจะถอยกลับ 'pointmap' โดยตรงสำหรับแต่ละภาพ ซึ่งเป็นพิกัด 3 มิติต่อพิกเซลที่หนาแน่น ซึ่งทั้งสองภาพแสดงในกรอบพิกัดเดียวกัน จากแผนผังจุดที่ตรงกันเหล่านี้ คุณสามารถอ่านความลึก ตำแหน่งกล้อง และการจับคู่ได้ฟรี สำหรับรูปภาพมากกว่าสองภาพ DUSt3R จะดำเนินการจัดตำแหน่งส่วนกลางโดยเย็บ pointmap แบบคู่ทั้งหมดให้อยู่ใน point cloud เดียวกัน ใช้งานได้แม้กับกล้องที่ไม่ได้ปรับเทียบและมีมุมมองที่เว้นระยะห่างกันน้อยมาก
ข้อมูลเชิงลึกทางเทคนิค
เอาต์พุตหลักคือแผนผังจุด: การทำแผนที่ 2D ถึง 3D ที่หนาแน่นซึ่งวางทุกพิกเซลของภาพในตำแหน่ง 3 มิติที่ชัดเจน โดยที่ภาพทั้งสองภาพถอยกลับเข้าไปในกรอบพิกัดของกล้องตัวแรก เนื่องจากการโต้ตอบนั้นมีความเกี่ยวข้องในพิกัด 3 มิติที่ใช้ร่วมกัน การประมาณค่าและการจับคู่จึงกลายเป็นการอ่านค่าดาวน์สตรีมมากกว่าข้อกำหนดเบื้องต้น Vision Transformer ที่มีความสนใจข้ามกันระหว่างสาขาภาพทั้งสองช่วยให้เครือข่ายมีเหตุผลร่วมกันเกี่ยวกับมุมมองทั้งสอง โดยเรียนรู้เรขาคณิตโดยตรงจากชุดข้อมูลขนาดใหญ่ของภาพที่จัดวาง
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการสร้าง 3D หนาแน่น DUSt3R ใหม่
DUSt3R จุดประกายสายงานที่เคลื่อนไหวอย่างรวดเร็ว - MASt3R เพิ่มการจับคู่ที่หนาแน่นที่แข็งแกร่ง และการติดตามผลผลักดันไปสู่ความสามารถในการปรับขนาดแบบเรียลไทม์และหลายมุมมอง แนวโน้มมีความชัดเจน: เรขาคณิตที่เรียนรู้จากต้นทางถึงปลายทางแทนที่ไปป์ไลน์ที่ออกแบบด้วยมือที่เปราะ คาดว่าโมเดล pointmap เหล่านี้จะป้อนโดยตรงไปยัง SLAM, หุ่นยนต์, AR และแม้กระทั่งการเริ่มต้นแบบ Gaussian-splatting ทำให้ภาพถ่ายในโทรศัพท์ทั่วไปเพียงพอที่จะสร้างระบบเมตริกและ 3 มิติที่สม่ำเสมอจากการถ่ายภาพเกือบทุกรูปแบบ
การใช้งานจริงในโลกแห่งความเป็นจริง
เปลี่ยนภาพถ่ายของห้องหรือวัตถุในโทรศัพท์ทั่วไปบางภาพให้เป็นพอยต์คลาวด์ 3 มิติที่ใช้งานได้โดยไม่ต้องสำรวจตำแหน่งของกล้อง
การกู้คืนท่าทางและความลึกของกล้องเพื่อบูตการสร้าง 3D ดาวน์สตรีมใหม่หรือการสาดแบบเกาส์เซียนจากภาพที่กระจัดกระจายและไม่มีการปรับเทียบ
การสร้างฉากขึ้นใหม่จากเอกสารสำคัญหรือภาพถ่ายทางอินเทอร์เน็ตที่ไม่มีข้อมูลการปรับเทียบกล้อง
ให้การประมาณค่าเรขาคณิตที่รวดเร็วสำหรับหุ่นยนต์และการนำทาง AR จากมุมมองเพียงสองหรือสามมุมมอง
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DUSt3R Dense 3D Reconstruction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ไปป์ไลน์การแปลงข้อความเป็น 3D Magic3D
คำถามที่พบบ่อย
What is DUSt3R Dense 3D Reconstruction?
DUSt3R สร้างรูปทรงเรขาคณิต 3 มิติที่มีความหนาแน่นสูงขึ้นมาใหม่จากภาพถ่ายธรรมดาจำนวนหนึ่งโดยไม่จำเป็นต้องทราบตำแหน่งกล้องหรือการสอบเทียบ โดยจะยุบไปป์ไลน์โฟโตแกรมเมทรีแบบหลายขั้นตอนแบบเดิมให้กลายเป็นโครงข่ายประสาทเทียมเดียวที่เพิ่งส่งออกจุด 3 มิติ
ข้อมูลสำคัญใดบ้างที่ DUSt3R ไม่ต้องการเป็นอินพุต ซึ่งแตกต่างจากโครงสร้างจากการเคลื่อนที่แบบคลาสสิก
DUSt3R ทำงานร่วมกับกล้องที่ไม่ได้ปรับเทียบและท่าทางที่ไม่รู้จัก มันประมาณเรขาคณิตโดยตรงจากภาพดิบ
เอาต์พุตส่วนกลางที่เครือข่ายของ DUSt3R ถอยกลับสำหรับแต่ละภาพคืออะไร
DUSt3R ทำนายแผนผังจุด โดยกำหนดพิกัด 3 มิติหนาแน่นให้กับทุกพิกเซล โดยที่รูปภาพทั้งสองของคู่กันอยู่ในกรอบพิกัดที่ใช้ร่วมกัน
ในคู่รูปภาพ DUSt3R จุดพิกัดทั้งสองเฟรมแสดงออกมาในรูปแบบใด
พอยต์แมปของภาพทั้งสองภาพจะถดถอยลงในกรอบพิกัดของกล้องตัวแรก ซึ่งทำให้เรขาคณิตของภาพสามารถเปรียบเทียบได้โดยตรง
DUSt3R รับตำแหน่งกล้องและการจับคู่พิกเซลได้อย่างไร
เนื่องจากการโต้ตอบนั้นมีความเกี่ยวข้องในพิกัด 3 มิติที่ใช้ร่วมกัน การโพสท่าและการจับคู่จะถูกอ่านจากพอยต์แมป แทนที่จะแก้ไขก่อน
DUSt3R จัดการกับอิมเมจอินพุตมากกว่าสองอิมเมจอย่างไร
สำหรับหลายมุมมอง DUSt3R จะดำเนินการจัดตำแหน่งทั่วโลกซึ่งจะหลอมรวม pointmap แบบคู่ทั้งหมดให้กลายเป็น point cloud ที่สอดคล้องกัน