Thế hệ chuyển văn bản thành 3D
Thế hệ chuyển văn bản thành 3D biến lời nhắc bằng văn bản như 'chiếc ghế bành bọc da cổ điển' thành mô hình 3D đầy đủ mà bạn có thể xoay, chiếu sáng và thả vào trò chơi hoặc cảnh.
Tổng quan
It promises to do for 3D assets what image generators did for pictures.
Lặn sâu
Hệ thống chuyển văn bản thành 3D tạo ra biểu diễn 3D (lưới, đám mây điểm hoặc trường rạng rỡ) từ một câu. Những bước đột phá ban đầu như DreamFusion của Google (2022) đã sử dụng Lấy mẫu chưng cất điểm: thay vì đào tạo về dữ liệu 3D, họ đã tối ưu hóa NeRF để mọi chế độ xem 2D được hiển thị trông hợp lý với mô hình khuếch tán hình ảnh 2D cố định. Điều này khởi động các hình dạng 3D từ các phiên bản 2D trước đó nhưng chậm, mất hàng giờ cho mỗi đối tượng và thường tạo ra 'vấn đề Janus' khi một sinh vật phát triển nhiều khuôn mặt. Các mô hình chuyển tiếp nguồn cấp dữ liệu mới hơn (Point-E và Shap-E của OpenAI, cộng với các mô hình tái tạo lớn và tách Gaussian) tạo ra nội dung trong vài giây đến vài phút. Chất lượng, tính nhất quán của nhiều chế độ xem, cấu trúc liên kết rõ ràng và kết cấu có thể sử dụng vẫn là những thách thức lớn.
Hiểu biết kỹ thuật
Thủ thuật cốt lõi của DreamFusion, Lấy mẫu chưng cất điểm (SDS), không cần dữ liệu đào tạo 3D. Nó hiển thị các chế độ xem ngẫu nhiên của NeRF, thêm nhiễu và hỏi mô hình khuếch tán 2D đã được huấn luyện trước cách khử nhiễu đối với dấu nhắc văn bản. Tín hiệu khử nhiễu đó trở thành một gradient làm dịch chuyển các tham số của NeRF để mọi góc nhìn đều khớp với lời nhắc. Mô hình 2D hoạt động như một nhà phê bình chắt lọc kiến thức về hình ảnh của nó thành một đối tượng 3D nhất quán.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của thế hệ chuyển văn bản thành 3D
Mong đợi sự thay đổi từ tối ưu hóa từng đối tượng chậm sang các trình tạo chuyển tiếp nhanh phát ra các mắt lưới sẵn sàng cho sản xuất với cấu trúc liên kết rõ ràng, các vật liệu riêng biệt và bản đồ UV trong vài giây. Các mô hình tái tạo lớn và phân tách Gaussian 3D đang đẩy nhanh quá trình này. Việc tích hợp vào các công cụ trò chơi, quy trình CAD và AR, cùng với tính năng chuyển văn bản thành 4D (đối tượng hoạt hình, chuyển động), sẽ tạo thói quen tạo nội dung trò chuyện, mặc dù việc dọn dẹp của con người để gian lận và tuân thủ thông số kỹ thuật trò chơi sẽ vẫn tiếp tục.
Triển khai trong thế giới thực
Studio trò chơi tạo nguyên mẫu các đạo cụ nền (thùng, đèn, tán lá) từ lời nhắc bằng văn bản để lấp đầy các cấp độ trước khi nghệ sĩ tinh chỉnh nội dung anh hùng.
Trang web thương mại điện tử tự động tạo bản xem trước sản phẩm 3D có thể xoay từ mô tả danh mục cho các tính năng AR 'xem trong phòng của bạn'.
Một kiến trúc sư nhanh chóng điền nội thất vào bản kết xuất hướng dẫn bằng cách nhập "ghế sofa giữa thế kỷ" thay vì duyệt qua thư viện nội dung.
Một nhóm chuẩn bị làm phim sẽ loại bỏ bối cảnh của một cảnh trong phần mô tả kịch bản để kiểm tra các góc quay trước khi xây dựng mô hình cuối cùng.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text-to-3D Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Đường ống chuyển văn bản thành 3D Magic3D
Câu hỏi thường gặp
What is Text-to-3D Generation?
Thế hệ chuyển văn bản thành 3D biến lời nhắc bằng văn bản như 'chiếc ghế bành bọc da cổ điển' thành mô hình 3D đầy đủ mà bạn có thể xoay, chiếu sáng và thả vào trò chơi hoặc cảnh. Nó hứa hẹn sẽ thực hiện được những gì đối với nội dung 3D mà các trình tạo hình ảnh đã làm cho hình ảnh.
Sự đổi mới quan trọng của DreamFusion (2022) là gì?
DreamFusion đã tối ưu hóa NeRF để mọi chế độ xem 2D được hiển thị đều đáp ứng mô hình khuếch tán hình ảnh 2D cố định, sử dụng SDS và không yêu cầu dữ liệu đào tạo 3D.
'Vấn đề Janus' trong chuyển văn bản sang 3D là gì?
Được đặt theo tên vị thần La Mã hai mặt, vấn đề Janus là khi một vật thể phát triển thêm các mặt vì mỗi chế độ xem 2D được tối ưu hóa phần nào một cách độc lập.
Cặp nào là mô hình chuyển tiếp nguồn cấp dữ liệu chuyển văn bản sang 3D đầu tiên của OpenAI?
OpenAI đã phát hành Point-E (đám mây điểm) và Shap-E, tạo ra nội dung 3D nhanh hơn nhiều so với các phương pháp dựa trên tối ưu hóa.
Tại sao các phương pháp dựa trên tối ưu hóa ban đầu như DreamFusion lại chậm?
Mỗi đối tượng đều yêu cầu tối ưu hóa NeRF lặp đi lặp lại trên nhiều kết xuất bị nhiễu, thường mất hàng giờ cho mỗi nội dung.
Định dạng đầu ra nào KHÔNG phải là biểu diễn 3D điển hình do các hệ thống này tạo ra?
Hệ thống chuyển văn bản thành 3D xuất ra các lưới, đám mây điểm hoặc trường bức xạ; MP3 là định dạng âm thanh, không phải là bản trình bày 3D.