HƯỚNG DẪN AI trực quan

Lấy mẫu chưng cất điểm và DreamFusion

DreamFusion tạo các đối tượng 3D từ văn bản bằng cách sử dụng mô hình khuếch tán hình ảnh 2D làm nhà phê bình, không bao giờ đào tạo về bất kỳ dữ liệu 3D nào.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.

Lặn sâu

DreamFusion, từ Google vào năm 2022, đã hỏi: mô hình chuyển văn bản thành hình ảnh 2D có thể dạy cảnh 3D nhìn đúng từ mọi góc độ không? Nó tối ưu hóa NeRF (Trường bức xạ thần kinh) để kết xuất từ ​​các góc nhìn ngẫu nhiên của máy ảnh, khi bị nhiễu và hiển thị dưới dạng mô hình khuếch tán đông lạnh (Imagen), được coi là hình ảnh hợp lý cho lời nhắc văn bản. Điều quan trọng là nó không sử dụng dữ liệu đào tạo 3D. Bước đột phá là Lấy mẫu chưng cất điểm (SDS): thay vì truyền ngược qua U-Net đắt tiền của mô hình khuếch tán, SDS sử dụng nhiễu dự đoán của mô hình làm tín hiệu chuyển màu trực tiếp trên các pixel được hiển thị. Việc lặp lại điều này qua hàng nghìn góc nhìn sẽ tạo ra một nội dung 3D mạch lạc, hoàn chỉnh với hình học và hình thức phụ thuộc vào chế độ xem, từ một câu duy nhất.

Hiểu biết kỹ thuật

SDS coi mô hình khuếch tán như một hàm tính điểm cố định. Nó kết xuất NeRF, thêm nhiễu, yêu cầu U-Net khuếch tán dự đoán nhiễu đó và tính toán độ dốc khi (nhiễu dự đoán trừ đi nhiễu bổ sung) được đẩy trở lại hình ảnh được hiển thị và do đó trọng số NeRF. Bỏ qua U-Net Jacobian làm cho nó dễ sử dụng hơn. Cần có hướng dẫn không cần phân loại cao (khoảng 100) để có kết quả sắc nét, điều này gây ra 'giao diện DreamFusion' quá bão hòa, đôi khi bị mờ.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của DreamFusion và Lấy mẫu chưng cất điểm

SDS đã tạo ra một loạt công việc phong phú để khắc phục các điểm yếu của nó: Magic3D cho độ phân giải và tốc độ, Chưng cất điểm biến đổi của ProlificDreamer cho kết quả đầu ra sắc nét hơn, đa dạng hơn và các phương pháp tấn công tạo tác nhiều mặt 'Janus'. Lĩnh vực này đang ngày càng kết hợp SDS với các ưu tiên khuếch tán nhiều chế độ xem và các biểu diễn 3D nhanh như Gaussian Splatting. Kỳ vọng chuyển văn bản thành 3D sẽ phát triển nhanh hơn và trung thực hơn về mặt hình học, thu hẹp khoảng cách với nội dung được mô hình hóa bằng tay.

Triển khai trong thế giới thực

Tạo mô hình 3D của 'ảnh DSLR chụp một con sóc đội chiếc mũ nhỏ' chỉ từ văn bản

Tạo nội dung AR và trò chơi nháp mà không cần điêu khắc 3D thủ công

Sản xuất các mắt lưới có thể xuất khẩu mà các nghệ sĩ tinh chỉnh thay vì xây dựng từ đầu

Cơ sở nghiên cứu để đánh giá các phương pháp chuyển văn bản thành 3D mới hơn so với SDS

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DreamFusion and Score Distillation Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình sáng tạo dựa trên điểm số

Câu hỏi thường gặp

What is DreamFusion and Score Distillation Sampling?

DreamFusion tạo các đối tượng 3D từ văn bản bằng cách sử dụng mô hình khuếch tán hình ảnh 2D làm nhà phê bình, không bao giờ đào tạo về bất kỳ dữ liệu 3D nào. Phát minh cốt lõi của nó, Lấy mẫu chưng cất điểm, đã trở thành công thức nền tảng cho toàn bộ lĩnh vực chuyển văn bản sang 3D.

DreamFusion tối ưu hóa phần trình bày 3D nào?

DreamFusion tối ưu hóa NeRF để các chế độ xem được hiển thị của nó đáp ứng đánh giá của mô hình khuếch tán 2D về lời nhắc văn bản.

DreamFusion yêu cầu bao nhiêu dữ liệu đào tạo 3D?

DreamFusion sử dụng mô hình khuếch tán văn bản thành hình ảnh 2D cố định làm giám sát duy nhất, không yêu cầu dữ liệu đào tạo 3D.

Phím tắt tính toán quan trọng trong Lấy mẫu chưng cất điểm là gì?

SDS sử dụng nhiễu được thêm vào được dự đoán dưới dạng gradient trực tiếp trên các pixel được hiển thị, tránh U-Net Jacobian tốn kém.

Tại sao DreamFusion sử dụng hướng dẫn không cần phân loại rất cao (~100)?

Độ dốc SDS nhiễu và yếu, do đó cần có hướng dẫn cao bất thường để có được hình học sắc nét, nhanh chóng, mặc dù nó gây ra độ bão hòa quá mức.

DreamFusion ban đầu đã sử dụng mô hình 2D nào khi bị đóng băng trước đó?

DreamFusion được xây dựng trên mô hình khuếch tán văn bản thành hình ảnh Imagen của Google dưới dạng chức năng chấm điểm cố định.