การสุ่มตัวอย่างการกลั่นด้วย DreamFusion และ Score
DreamFusion สร้างวัตถุ 3 มิติจากข้อความโดยใช้แบบจำลองการแพร่กระจายภาพ 2 มิติในฐานะนักวิจารณ์ โดยไม่เคยฝึกอบรมข้อมูล 3 มิติใดๆ เลย
ภาพรวม
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
เจาะลึก
DreamFusion จาก Google ในปี 2022 ถามว่าโมเดลข้อความเป็นรูปภาพ 2 มิติสามารถสอนฉาก 3 มิติให้ดูถูกต้องจากทุกมุมได้หรือไม่ โดยจะปรับ NeRF (Neural Radiance Field) ให้เหมาะสม เพื่อให้การเรนเดอร์จากมุมมองของกล้องแบบสุ่ม เมื่อมีสัญญาณรบกวนและแสดงไปยังโมเดลการแพร่กระจายแบบเยือกแข็ง (Imagen) จะให้คะแนนเป็นรูปภาพที่น่าเชื่อถือสำหรับข้อความแจ้ง สิ่งสำคัญที่สุดคือไม่ใช้ข้อมูลการฝึกอบรม 3 มิติ ความก้าวหน้าครั้งนี้คือการสุ่มตัวอย่างการกลั่นคะแนน (SDS) แทนที่จะแพร่กระจายกลับผ่าน U-Net ที่มีราคาแพงของโมเดลการแพร่กระจาย SDS จะใช้สัญญาณรบกวนที่คาดการณ์ของโมเดลเป็นสัญญาณการไล่ระดับสีโดยตรงบนพิกเซลที่เรนเดอร์ การทำซ้ำสิ่งนี้ในมุมมองนับพันจะทำให้เกิดเนื้อหา 3 มิติที่สอดคล้องกัน พร้อมด้วยรูปทรงเรขาคณิตและรูปลักษณ์ที่ขึ้นอยู่กับมุมมองจากประโยคเดียว
ข้อมูลเชิงลึกทางเทคนิค
SDS ถือว่าโมเดลการแพร่กระจายเป็นฟังก์ชันการให้คะแนนแบบแช่แข็ง มันเรนเดอร์ NeRF เพิ่มสัญญาณรบกวน ขอให้ U-Net การแพร่กระจายทำนายสัญญาณรบกวนนั้น และคำนวณการไล่ระดับสีในขณะที่ (สัญญาณรบกวนที่คาดการณ์ลบสัญญาณรบกวนที่เพิ่มเข้ามา) ดันกลับเข้าสู่ภาพที่เรนเดอร์ และด้วยเหตุนี้จึงให้น้ำหนัก NeRF การข้าม U-Net Jacobian ทำให้สามารถเข้าใจได้ง่าย จำเป็นต้องมีคำแนะนำแบบไม่มีตัวแยกประเภทสูง (ประมาณ 100) เพื่อให้ได้ผลลัพธ์ที่คมชัด ซึ่งทำให้ลักษณะ "DreamFusion look" อิ่มตัวมากเกินไป และบางครั้งก็พร่ามัว
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการเก็บตัวอย่างการกลั่นด้วย DreamFusion และการกลั่นด้วยคะแนน
SDS สร้างสายงานมากมายเพื่อแก้ไขจุดอ่อน: Magic3D สำหรับความละเอียดและความเร็ว, ProlificDreamer's Variational Score Distillation เพื่อผลลัพธ์ที่คมชัดและหลากหลายยิ่งขึ้น และวิธีการโจมตีสิ่งประดิษฐ์หลายหน้า 'Janus' ฟิลด์นี้กำลังจับคู่ SDS มากขึ้นกับตัวกระจายหลายมุมมองและการแสดงภาพ 3 มิติที่รวดเร็ว เช่น Gaussian Splatting คาดว่าการแปลงข้อความเป็น 3D จะเติบโตเร็วขึ้นและมีความเที่ยงตรงทางเรขาคณิตมากขึ้น ลดช่องว่างด้วยเนื้อหาที่สร้างแบบจำลองด้วยมือ
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างโมเดล 3 มิติของ 'ภาพถ่าย DSLR ของกระรอกสวมหมวกจิ๋ว' จากข้อความเพียงอย่างเดียว
การสร้างเกมร่างและเนื้อหา AR โดยไม่ต้องแกะสลัก 3 มิติด้วยตนเอง
การผลิตตาข่ายที่สามารถส่งออกได้ซึ่งศิลปินปรับแต่ง แทนที่จะสร้างใหม่ตั้งแต่ต้น
พื้นฐานการวิจัยสำหรับการประเมินวิธีการแปลงข้อความเป็น 3D รุ่นใหม่เทียบกับ SDS
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โมเดลกำเนิดตามคะแนน
คำถามที่พบบ่อย
What is DreamFusion and Score Distillation Sampling?
DreamFusion สร้างวัตถุ 3 มิติจากข้อความโดยใช้แบบจำลองการแพร่กระจายภาพ 2 มิติในฐานะนักวิจารณ์ โดยไม่เคยฝึกอบรมข้อมูล 3 มิติใดๆ เลย สิ่งประดิษฐ์หลักของบริษัท นั่นคือ Score Distillation Sampling กลายเป็นสูตรพื้นฐานสำหรับฟิลด์ข้อความเป็น 3D ทั้งหมด
DreamFusion ปรับการแสดงภาพ 3D ใดให้เหมาะสมที่สุด
DreamFusion เพิ่มประสิทธิภาพ NeRF เพื่อให้มุมมองที่เรนเดอร์เป็นไปตามการตัดสินใจของโมเดลการแพร่กระจาย 2D ของข้อความแจ้ง
DreamFusion ต้องการข้อมูลการฝึก 3D เท่าใด
DreamFusion ใช้โมเดลการแพร่กระจายข้อความเป็นรูปภาพ 2D แบบแช่แข็งเป็นการควบคุมเพียงอย่างเดียว โดยไม่ต้องใช้ข้อมูลการฝึก 3D
ทางลัดการคำนวณที่สำคัญในการสุ่มตัวอย่างการกลั่นด้วยคะแนนคืออะไร
SDS ใช้สัญญาณรบกวนที่คาดการณ์ลบเพิ่มเป็นการไล่ระดับสีโดยตรงบนพิกเซลที่เรนเดอร์ หลีกเลี่ยง U-Net Jacobian ที่มีราคาแพง
เหตุใด DreamFusion จึงใช้คำแนะนำที่ไม่มีตัวแยกประเภทที่สูงมาก (~ 100)
การไล่ระดับสี SDS มีสัญญาณรบกวนและอ่อนแอ ดังนั้นจึงจำเป็นต้องมีการนำทางที่สูงผิดปกติสำหรับรูปทรงเรขาคณิตที่คมชัดและรวดเร็ว แม้ว่าจะทำให้เกิดความอิ่มตัวมากเกินไปก็ตาม
DreamFusion ดั้งเดิมเคยใช้โมเดล 2 มิติใดเป็นโมเดลแช่แข็งมาก่อน
DreamFusion สร้างขึ้นจากโมเดลการแพร่กระจายข้อความเป็นรูปภาพ Imagen ของ Google เป็นฟังก์ชันการให้คะแนนแบบแช่แข็ง