คู่มือ AI แบบเห็นภาพ

การแพร่กระจายมุมมองนวนิยายแบบ Zero-1 ถึง 3

Zero-1-to-3 เปลี่ยนภาพถ่ายเดี่ยวของวัตถุให้เป็นภาพของวัตถุเดียวกันนั้นที่มองเห็นได้จากมุมใหม่ โดยใช้แบบจำลองการแพร่กระจายที่มีเงื่อนไขตามการหมุนกล้องที่คุณต้องการ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

เจาะลึก

Zero-1-to-3 (จาก Columbia, 2023) ปรับการกระจายความเสถียรอย่างละเอียด เพื่อให้สามารถสังเคราะห์มุมมองใหม่แบบ Zero-shot จากภาพที่ป้อนเข้าเพียงภาพเดียว คุณป้อนรูปภาพหนึ่งภาพบวกกับการแปลงกล้องแบบสัมพัทธ์ (การหมุนและการแปลเล็กน้อย) และแบบจำลองจะสร้างลักษณะของวัตถุจากมุมมองใหม่นั้น แนวคิดหลักคือโมเดลการแพร่กระจาย 2D ขนาดใหญ่ ซึ่งได้รับการฝึกฝนเกี่ยวกับคอลเลกชันรูปภาพบนเว็บขนาดใหญ่ ได้ดูดซับลักษณะทางเรขาคณิตและกายภาพโดยปริยายเกี่ยวกับลักษณะของวัตถุในรูปแบบ 3 มิติ ด้วยการปรับแต่งอย่างละเอียดบนชุดข้อมูลสังเคราะห์ของออบเจ็กต์ที่เรนเดอร์จากมุมกล้องที่ได้รับการควบคุมหลายๆ มุม (โดยใช้ Objaverse) โมเดลจะเรียนรู้ที่จะแมปสิ่งที่สำคัญเหล่านั้นเข้ากับการควบคุมกล้องที่ชัดเจน มุมมองที่สร้างขึ้นสามารถป้อนการสร้าง 3D ดาวน์สตรีมได้

ข้อมูลเชิงลึกทางเทคนิค

เงื่อนไขของโมเดลในรูปภาพต้นฉบับมี 2 วิธี: การฝัง CLIP จะต่อเข้ากับท่ากล้องที่สัมพันธ์กัน (แอซิมัท ระดับความสูง รัศมี) เพื่อควบคุมการสนใจข้าม ในขณะที่ภาพดิบจะต่อเข้ากับสัญญาณแฝงที่มีสัญญาณรบกวน ดังนั้นรายละเอียดและเอกลักษณ์ที่ละเอียดอ่อนจึงถูกรักษาไว้ การฝึกอบรมใช้ภาพสามรูปแบบที่เรนเดอร์จากวัตถุ CAD ดังนั้นเครือข่ายจึงเรียนรู้การแมปที่ควบคุมได้ระหว่างการเปลี่ยนแปลงมุมมองและการเปลี่ยนแปลงพิกเซลที่เกิดขึ้น

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแพร่กระจายมุมมองนวนิยายแบบ Zero-1 ถึง 3

Zero-1-to-3 ทำให้เกิดคลื่นของท่อส่งภาพเป็น 3D ผู้สืบทอดเช่น Zero123-XL, SyncDreamer และ One-2-3-45 ผลักดันไปสู่ความสอดคล้องหลายมุมมองและเอาต์พุต 3D mesh ที่เร็วขึ้นและเชื่อถือได้มากขึ้น ในขณะที่การบูรณาการกับ Gaussian Splatting และโมเดลการสร้างใหม่ขนาดใหญ่กำลังลดเวลาในการสร้างจากนาทีเหลือเพียงวินาที คาดหวังความสอดคล้องของมุมมองที่แคบยิ่งขึ้น ความละเอียดที่สูงขึ้น และลักษณะทั่วไปในโลกแห่งความเป็นจริง (ไม่ใช่แค่วัตถุสังเคราะห์) เนื่องจากโมเดลการแพร่กระจายที่ควบคุมมุมมองได้เหล่านี้จะกลายเป็นเครื่องมือมาตรฐานสำหรับการสร้างเนื้อหา

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างมุมมองแบบหมุนได้ของภาพถ่ายผลิตภัณฑ์เดียวเพื่อให้รายการอีคอมเมิร์ซสามารถแสดงรายการจากทุกด้าน

การเริ่มต้นสร้างตาข่าย 3 มิติที่มีพื้นผิวของวัตถุจากสแน็ปช็อตในโทรศัพท์ทั่วไปสำหรับการแสดงตัวอย่าง AR

การสร้างงานศิลปะอ้างอิงหลายมุมที่สอดคล้องกันของตัวละครหรืออุปกรณ์ประกอบฉากสำหรับศิลปินที่มีแนวคิดเกี่ยวกับเกมและภาพยนตร์

ป้อนมุมมองใหม่ที่ได้รับการสังเคราะห์ลงในการสร้าง NeRF หรือ Gaussian Splatting ใหม่เพื่อเติมเต็มรูปทรงเรขาคณิตที่มองไม่เห็น

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสังเคราะห์มุมมองนวนิยาย

คำถามที่พบบ่อย

What is Zero-1-to-3 Novel View Diffusion?

Zero-1-to-3 เปลี่ยนภาพถ่ายเดี่ยวของวัตถุให้เป็นภาพของวัตถุเดียวกันนั้นที่มองเห็นได้จากมุมใหม่ โดยใช้แบบจำลองการแพร่กระจายที่มีเงื่อนไขตามการหมุนกล้องที่คุณต้องการ สิ่งสำคัญคือช่วยให้คุณสร้างมุมมองที่สอดคล้องกัน 3 มิติได้โดยไม่ต้องสแกนวัตถุจากหลายด้านเลย

อินพุตหลักที่ Zero-1-to-3 ต้องการคืออะไรนอกเหนือจากภาพเดียวเพื่อสร้างมุมมองใหม่

Zero-1-to-3 ถูกกำหนดเงื่อนไขบนภาพเดียวบวกกับท่าทางกล้องที่สัมพันธ์กัน ดังนั้นคุณจึงระบุการหมุนและการแปลไปยังมุมมองที่ต้องการ

Zero-1-to-3 ถูกสร้างขึ้นโดยการปรับแต่งรุ่นใด?

โดยจะปรับแต่งโมเดลการแพร่กระจาย 2D ขนาดใหญ่ที่ได้รับการฝึกล่วงหน้าขนาดใหญ่ เพื่อให้สามารถใช้ประโยชน์จากโครงสร้างทางเรขาคณิตที่โมเดลเหล่านั้นเรียนรู้โดยปริยายจากรูปภาพบนเว็บ

เหตุใดโมเดลการแพร่กระจาย 2 มิติจึงสามารถทำการสังเคราะห์มุมมองใหม่แบบ Zero-shot ได้เลย

การฝึกอบรม 2D ขนาดใหญ่ให้ความรู้โดยนัยว่าวัตถุปรากฏใน 3D อย่างไร ซึ่งการปรับแต่งอย่างละเอียดทำให้สามารถควบคุมได้ผ่านท่าทางกล้อง

ชุดข้อมูลใดของวัตถุ 3 มิติที่เป็นศูนย์กลางในการฝึกอบรม Zero-1-to-3

ได้รับการฝึกฝนเกี่ยวกับภาพแฝดสามที่เรนเดอร์จากคอลเลกชันวัตถุสังเคราะห์ 3 มิติขนาดใหญ่ เช่น Objaverse

รายละเอียดเล็กๆ น้อยๆ ของภาพต้นฉบับจะคงอยู่ในยุคนี้ได้อย่างไร

รูปภาพดิบถูกเชื่อมต่อเข้ากับสัญญาณแฝงที่มีสัญญาณรบกวน (ควบคู่ไปกับ CLIP ที่ฝังไว้สำหรับความหมาย) เพื่อให้ข้อมูลประจำตัวและรายละเอียดดำเนินต่อไป