การสังเคราะห์มุมมองนวนิยาย
การสังเคราะห์มุมมองใหม่จะสร้างภาพเสมือนจริงของฉากจากมุมมองที่ไม่เคยถูกถ่ายภาพจริง
ภาพรวม
มันสําคัญเพราะมันเปลี่ยนภาพถ่ายไม่กี่ภาพให้กลายเป็นฉาก 3D ที่สํารวจได้อย่างเต็มที่ ขับเคลื่อนสื่อสมจริง, VR และดิจิทัลทวิน
เจาะลึก
การสังเคราะห์มุมมองใหม่ (NVS) จะนำชุดอินพุตภาพที่มีท่าทางกล้องที่รู้จัก และเรนเดอร์ฉากจากตำแหน่งกล้องใหม่ที่มองไม่เห็น แทนที่จะสร้างตาข่ายที่ชัดเจนขึ้นมาใหม่ NVS สมัยใหม่มักจะเรียนรู้การนำเสนอรูปลักษณ์และเรขาคณิตของฉากอย่างต่อเนื่อง Neural Radiance Fields (NeRF) เข้ารหัสฉากเป็นฟังก์ชันที่แมปตำแหน่ง 3 มิติและทิศทางการรับชมเป็นสีและความหนาแน่น จากนั้นสังเคราะห์มุมมองโดยการเดินรังสีปริมาตร สุ่มจุดตามรังสีแต่ละพิกเซล และบูรณาการเข้าด้วยกัน 3D Gaussian Splatting นำเสนอฉากที่ 3D Gaussians หลากสีนับล้านถูกแรสเตอร์แบบเรียลไทม์ ทั้งสองจับภาพเอฟเฟกต์ที่ขึ้นกับมุมมอง เช่น ภาพสะท้อนและไฮไลท์แบบ Specular ซึ่งให้ผลลัพธ์ที่สมจริงอย่างน่าทึ่งซึ่งไปป์ไลน์ที่ใช้รูปทรงเรขาคณิตแบบดั้งเดิมนั้นดิ้นรนเพื่อให้เข้ากันได้
ข้อมูลเชิงลึกทางเทคนิค
NeRF ฝึกโครงข่ายประสาทเทียมขนาดเล็กโดยการควบคุมโฟโตเมตริกเพียงอย่างเดียว โดยในแต่ละพิกเซลการฝึกจะส่งสัญญาณรังสี ตัวอย่างจุด 3 มิติ ค้นหาสีและความหนาแน่น และรวมเข้าด้วยกันผ่านอินทิกรัลการเรนเดอร์ปริมาตร จากนั้นจึงเผยแพร่ความแตกต่างจากพิกเซลจริงกลับคืน การเข้ารหัสตำแหน่งช่วยให้เครือข่ายแสดงรายละเอียดความถี่สูง Gaussian Splatting ยกเลิกเครือข่ายต่อเรย์เพื่อสนับสนุน Gaussians ที่ชัดเจนและการแรสเตอร์เชิงอนุพันธ์ แลกเปลี่ยนหน่วยความจำเพื่อการฝึกอบรมที่เร็วขึ้นและการเรนเดอร์แบบเรียลไทม์
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการสังเคราะห์มุมมองนวนิยาย
NVS เริ่มเร็วขึ้น แก้ไขได้ และมีไดนามิกอย่างรวดเร็ว เทคนิคต่างๆ เช่น Instant-NGP จะตัดการฝึกจากชั่วโมงเหลือเพียงวินาที ในขณะที่วิธี 4D จะขยายแถบเกาส์เซียนไปยังฉากที่เคลื่อนไหว คาดหวังโมเดลกำเนิดที่ทำให้เกิดภาพหลอนในพื้นที่ที่มองไม่เห็นที่เป็นไปได้จากรูปภาพกระจัดกระจายหรือรูปภาพเดี่ยว บูรณาการกับข้อความเป็น 3 มิติ อวตารที่ปรับแสงได้และเคลื่อนไหวได้ และสตรีมมิ่งฟิลด์รัศมี ทำให้การจับภาพเชิงปริมาตรใช้งานได้จริงสำหรับภาพยนตร์ การแสดงทางไกล การจำลองหุ่นยนต์ และ AR สำหรับผู้บริโภค
การใช้งานจริงในโลกแห่งความเป็นจริง
เปลี่ยนวิดีโอในโทรศัพท์ของวัตถุให้เป็นฉาก 3 มิติที่น่าสำรวจสำหรับอีคอมเมิร์ซหรือทัวร์เสมือนจริง
การสร้างการเล่นซ้ำแบบแสดงเวลากระสุนและมุมมองอิสระในกีฬาและภาพยนตร์จากการถ่ายภาพหลายกล้อง
สร้างห้องและสภาพแวดล้อมดิจิทัลเสมือนจริงเสมือนจริงสำหรับการแนะนำ VR และอสังหาริมทรัพย์
การสร้างสภาพแวดล้อมการฝึกอบรมและทรัพย์สินสำหรับการจำลองหุ่นยนต์และยานพาหนะอัตโนมัติ
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Novel View Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การแพร่กระจายมุมมองนวนิยายแบบ Zero-1 ถึง 3
คำถามที่พบบ่อย
Novel View Synthesis คืออะไร?
การสังเคราะห์มุมมองใหม่จะสร้างภาพเสมือนจริงของฉากจากมุมมองที่ไม่เคยถูกถ่ายภาพจริง สิ่งสำคัญคือการเปลี่ยนภาพถ่ายจำนวนหนึ่งให้เป็นฉาก 3D ที่น่าสำรวจได้อย่างเต็มที่ ขับเคลื่อนสื่อที่ดื่มด่ำ, VR และแฝดดิจิทัล
เป้าหมายของการสังเคราะห์มุมมองใหม่คืออะไร?
การสังเคราะห์มุมมองใหม่จะสร้างภาพที่เหมือนจริงจากมุมมองใหม่ๆ ที่มองไม่เห็นโดยใช้ชุดของภาพที่นำเข้าพร้อมท่าทางที่รู้จัก
Neural Radiance Field (NeRF) ทำแผนที่ตำแหน่ง 3 มิติและทิศทางการรับชมเพื่ออะไร
NeRF เรียนรู้ฟังก์ชันจาก (ตำแหน่ง ทิศทาง) ไปจนถึงสีและความหนาแน่นที่ปล่อยออกมา ซึ่งจากนั้นจะรวมเข้ากับรังสีเพื่อแสดงภาพ
NeRF เรนเดอร์พิกเซลสำหรับมุมมองใหม่อย่างไร
สำหรับแต่ละพิกเซล NeRF จะส่งรังสี เก็บตัวอย่างจุด 3D ค้นหาเครือข่ายเพื่อหาสี/ความหนาแน่น และรวมเข้าด้วยกันด้วยอินทิกรัลการเรนเดอร์ปริมาตร
อะไรคือความแตกต่างที่สำคัญในการนำเสนอของ 3D Gaussian Splatting เมื่อเทียบกับ NeRF?
Gaussian Splatting นำเสนอฉากด้วย 3D Gaussian ดั้งเดิมที่ชัดเจนและการแรสเตอร์เชิงอนุพันธ์ ทำให้สามารถเรนเดอร์แบบเรียลไทม์ได้เร็วกว่าการสืบค้นเครือข่ายแบบต่อเรย์ของ NeRF มาก
เหตุใดวิธี NVS จึงสามารถสร้างการสะท้อนและไฮไลท์ที่แวววาวได้
ด้วยการปรับสีตามทิศทางการรับชม แถบ NeRF และ Gaussian จะจับภาพเอฟเฟกต์ที่ขึ้นกับการมองเห็น เช่น ไฮไลท์แบบ Specular และการสะท้อน