คู่มือ AI แบบเห็นภาพ

การสร้างข้อความเป็น 3D

การสร้างข้อความเป็น 3D จะเปลี่ยนข้อความที่เขียน เช่น 'เก้าอี้หนังวินเทจ' ให้เป็นโมเดล 3 มิติเต็มรูปแบบที่คุณสามารถหมุน เพิ่มแสง และวางลงในเกมหรือฉากได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It promises to do for 3D assets what image generators did for pictures.

เจาะลึก

ระบบแปลงข้อความเป็น 3 มิติจะสร้างการแสดงภาพ 3 มิติ (เมช พอยต์คลาวด์ หรือฟิลด์ความกระจ่างใส) จากประโยค ความก้าวหน้าในช่วงแรกๆ เช่น DreamFusion (2022) ของ Google ใช้การสุ่มตัวอย่างการกลั่นคะแนน: แทนที่จะฝึกกับข้อมูล 3 มิติ พวกเขาปรับ NeRF ให้เหมาะสม เพื่อให้ทุกมุมมอง 2 มิติที่เรนเดอร์ดูเป็นไปได้สำหรับโมเดลการแพร่กระจายภาพ 2 มิติที่ค้างอยู่ สิ่งนี้เป็นการบูตรูปร่าง 3 มิติจาก 2 มิติก่อนหน้านี้ แต่ช้า โดยใช้เวลาหลายชั่วโมงต่อวัตถุ และมักจะทำให้เกิด 'ปัญหาเจนัส' ที่สิ่งมีชีวิตเติบโตหลายหน้า โมเดลฟีดฟอร์เวิร์ดที่ใหม่กว่า (Point-E และ Shap-E ของ OpenAI รวมถึงโมเดลการสาดแบบเกาส์เซียนและการสร้างใหม่ขนาดใหญ่) สร้างเนื้อหาในไม่กี่วินาทีถึงนาที คุณภาพ ความสอดคล้องหลายมุมมอง โทโพโลยีที่สะอาดตา และพื้นผิวที่ใช้งานได้ยังคงเป็นความท้าทายที่ยังคงดำเนินอยู่

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับหลักของ DreamFusion นั่นคือ Score Distillation Sampling (SDS) ไม่จำเป็นต้องใช้ข้อมูลการฝึกอบรม 3 มิติ โดยจะเรนเดอร์มุมมองแบบสุ่มของ NeRF เพิ่มสัญญาณรบกวน และถามโมเดลการแพร่กระจาย 2D ที่ได้รับการฝึกไว้ล่วงหน้าว่าจะปฏิเสธข้อความแจ้งได้อย่างไร สัญญาณ denoising นั้นจะกลายเป็นการไล่ระดับสีที่เขยิบพารามิเตอร์ของ NeRF ดังนั้นทุกมุมมองจึงตรงกับข้อความแจ้ง โมเดล 2 มิติทำหน้าที่เป็นนักวิจารณ์ที่กลั่นกรองความรู้ด้านภาพให้เป็นวัตถุ 3 มิติที่สอดคล้องกัน

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการสร้างข้อความเป็น 3D

คาดว่าจะมีการเปลี่ยนแปลงจากการเพิ่มประสิทธิภาพต่ออ็อบเจ็กต์ที่ช้าไปเป็นเครื่องกำเนิดฟีดไปข้างหน้าที่รวดเร็วซึ่งปล่อย mesh ที่พร้อมสำหรับการผลิตพร้อมโทโพโลยีที่สะอาดตา วัสดุที่แยกออกจากกัน และแผนที่ UV ได้ในไม่กี่วินาที การสาดแบบเกาส์เซียน 3 มิติและแบบจำลองการสร้างใหม่ขนาดใหญ่กำลังเร่งสิ่งนี้ การบูรณาการเข้ากับเอ็นจิ้นเกม, CAD และไปป์ไลน์ AR รวมถึงการแปลงข้อความเป็น 4D (วัตถุเคลื่อนไหวและเคลื่อนไหว) จะสร้างกิจวัตรการสร้างเนื้อหาการสนทนา แม้ว่าการล้างข้อมูลโดยมนุษย์สำหรับเสื้อผ้าและการปฏิบัติตามข้อกำหนดของเกมจะยังคงอยู่

การใช้งานจริงในโลกแห่งความเป็นจริง

สตูดิโอเกมสร้างต้นแบบอุปกรณ์ประกอบฉากพื้นหลัง (ลัง โคมไฟ ใบไม้) จากข้อความแจ้งเพื่อเติมระดับก่อนที่ศิลปินจะปรับแต่งทรัพย์สินของฮีโร่

ไซต์อีคอมเมิร์ซสร้างตัวอย่างผลิตภัณฑ์ 3 มิติแบบหมุนได้อัตโนมัติจากคำอธิบายแคตตาล็อกสำหรับฟีเจอร์ 'ดูในห้องของคุณ' ของ AR

สถาปนิกสร้างภาพเรนเดอร์พร้อมเฟอร์นิเจอร์อย่างรวดเร็วโดยพิมพ์ "โซฟากลางศตวรรษ" แทนการเรียกดูไลบรารีแอสเซท

ทีมพรีวิซภาพยนตร์จะบล็อกการตกแต่งฉากของฉากจากคำอธิบายสคริปต์เพื่อทดสอบมุมกล้องก่อนสร้างโมเดลขั้นสุดท้าย

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text-to-3D Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ไปป์ไลน์การแปลงข้อความเป็น 3D Magic3D

คำถามที่พบบ่อย

What is Text-to-3D Generation?

การสร้างข้อความเป็น 3D จะเปลี่ยนข้อความที่เขียน เช่น 'เก้าอี้หนังวินเทจ' ให้เป็นโมเดล 3 มิติเต็มรูปแบบที่คุณสามารถหมุน เพิ่มแสง และวางลงในเกมหรือฉากได้ สัญญาว่าจะทำเพื่อเนื้อหา 3 มิติเหมือนกับที่โปรแกรมสร้างภาพทำเพื่อรูปภาพ

นวัตกรรมหลักของ DreamFusion (2022) คืออะไร

DreamFusion เพิ่มประสิทธิภาพ NeRF เพื่อให้ทุกมุมมอง 2D ที่เรนเดอร์เป็นไปตามโมเดลการแพร่กระจายภาพ 2D ที่หยุดนิ่ง โดยใช้ SDS และไม่ต้องใช้ข้อมูลการฝึก 3D

'ปัญหาเจนัส' ในการแปลงข้อความเป็น 3 มิติคืออะไร

ตั้งชื่อตามเทพเจ้าโรมันที่มีสองหน้า ปัญหาของเจนัสคือเมื่อวัตถุมีใบหน้าเพิ่มขึ้นเป็นพิเศษ เนื่องจากมุมมอง 2 มิติแต่ละภาพได้รับการปรับให้เหมาะสมอย่างเป็นอิสระ

คู่ใดคือโมเดลการส่งต่อข้อความเป็น 3D ยุคแรกของ OpenAI

OpenAI เปิดตัว Point-E (point cloud) และ Shap-E ซึ่งสร้างเนื้อหา 3 มิติได้เร็วกว่าวิธีการเพิ่มประสิทธิภาพมาก

เหตุใดวิธีการเพิ่มประสิทธิภาพในช่วงแรกอย่าง DreamFusion จึงช้า

แต่ละอ็อบเจ็กต์จำเป็นต้องเพิ่มประสิทธิภาพ NeRF ซ้ำๆ กับการเรนเดอร์ที่มีสัญญาณรบกวนจำนวนมาก ซึ่งมักจะใช้เวลาหลายชั่วโมงต่อเนื้อหา

รูปแบบเอาต์พุตใดที่ไม่ใช่การแสดง 3D ทั่วไปที่สร้างโดยระบบเหล่านี้

ระบบแปลงข้อความเป็น 3 มิติเอาท์พุตเมช เมฆพอยต์ หรือฟิลด์ความกระจ่างใส MP3 เป็นรูปแบบเสียง ไม่ใช่การแสดง 3D