HƯỚNG DẪN AI trực quan

Khuếch tán chế độ xem tiểu thuyết từ 0 đến 3

Zero-1-to-3 biến một bức ảnh của một vật thể thành hình ảnh của cùng một vật thể đó được nhìn từ bất kỳ góc độ mới nào, sử dụng mô hình khuếch tán được điều chỉnh theo góc quay camera mà bạn yêu cầu.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

Lặn sâu

Zero-1-to-3 (từ Columbia, 2023) tinh chỉnh Khuếch tán ổn định để nó có thể thực hiện tổng hợp chế độ xem mới không chụp từ một hình ảnh đầu vào. Bạn cung cấp cho nó một hình ảnh duy nhất cộng với một biến đổi camera tương đối (xoay và dịch nhỏ) và mô hình sẽ tạo ra đối tượng sẽ trông như thế nào từ góc nhìn mới đó. Ý tưởng chính là các mô hình khuếch tán 2D lớn, được đào tạo trên các bộ sưu tập hình ảnh web khổng lồ, đã ngầm tiếp thu các tiên đoán hình học và vật lý về cách các vật thể trông như thế nào trong 3D. Bằng cách tinh chỉnh tập dữ liệu tổng hợp về các đối tượng được hiển thị từ nhiều góc camera được điều khiển (sử dụng Objaverse), mô hình này sẽ học cách ánh xạ các thông tin ưu tiên đó vào điều khiển camera rõ ràng. Sau đó, các chế độ xem được tạo có thể cung cấp dữ liệu tái tạo 3D xuôi dòng.

Hiểu biết kỹ thuật

Mô hình tạo điều kiện cho hình ảnh nguồn theo hai cách: nhúng CLIP được nối với tư thế máy ảnh tương đối (góc phương vị, độ cao, bán kính) để điều khiển sự chú ý chéo, trong khi hình ảnh thô được nối kênh với âm thanh tiềm ẩn để chi tiết và bản sắc tốt được bảo tồn. Quá trình đào tạo sử dụng bộ ba hình ảnh-tư thế-hình ảnh được kết xuất từ ​​các đối tượng CAD, do đó mạng học cách ánh xạ có thể kiểm soát được giữa thay đổi góc nhìn và thay đổi pixel thu được.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của việc phổ biến chế độ xem tiểu thuyết từ 0 đến 3

Zero-1-to-3 đã tạo ra một làn sóng chuyển đổi hình ảnh sang 3D. Những phiên bản kế nhiệm như Zero123-XL, SyncDreamer và One-2-3-45 hướng tới tính nhất quán của nhiều chế độ xem và đầu ra lưới 3D nhanh hơn, đáng tin cậy hơn, trong khi việc tích hợp với Gaussian Splatting và các mô hình tái thiết lớn đang giảm thời gian tạo từ vài phút xuống còn vài giây. Mong đợi tính nhất quán của chế độ xem chặt chẽ hơn, độ phân giải cao hơn và tính khái quát trong thế giới thực (không chỉ đối tượng tổng hợp) khi các mô hình khuếch tán có thể kiểm soát theo quan điểm này phát triển thành các công cụ tiêu chuẩn để tạo nội dung.

Triển khai trong thế giới thực

Tạo chế độ xem bàn xoay của một ảnh sản phẩm để danh sách thương mại điện tử có thể hiển thị mặt hàng đó từ mọi phía

Khởi tạo lưới 3D có kết cấu của một đối tượng từ một ảnh chụp nhanh điện thoại thông thường để xem trước AR

Tạo nghệ thuật tham khảo đa góc độ nhất quán về nhân vật hoặc chỗ dựa cho các nghệ sĩ ý tưởng trò chơi và phim

Đưa các chế độ xem mới tổng hợp vào bản tái tạo NeRF hoặc Gaussian Splatting để điền vào hình học vô hình

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tổng hợp chế độ xem tiểu thuyết

Câu hỏi thường gặp

What is Zero-1-to-3 Novel View Diffusion?

Zero-1-to-3 biến một bức ảnh của một vật thể thành hình ảnh của cùng một vật thể đó được nhìn từ bất kỳ góc độ mới nào, sử dụng mô hình khuếch tán được điều chỉnh theo góc quay camera mà bạn yêu cầu. Điều này quan trọng vì nó cho phép bạn xây dựng lại các chế độ xem nhất quán 3D mà không cần quét đối tượng từ nhiều phía.

Đầu vào cốt lõi mà Zero-1-to-3 cần ngoài một hình ảnh để tạo chế độ xem mới là gì?

Zero-1-to-3 được điều chỉnh trên một hình ảnh duy nhất cộng với tư thế máy ảnh tương đối, do đó bạn chỉ định góc xoay và dịch sang góc nhìn mong muốn.

Zero-1-to-3 được xây dựng bằng cách tinh chỉnh loại mô hình nào?

Nó tinh chỉnh một mô hình khuếch tán 2D được huấn luyện trước lớn để có thể khai thác các ưu tiên hình học mà các mô hình đó đã học được từ hình ảnh trên web.

Tại sao mô hình khuếch tán 2D có thể thực hiện tổng hợp chế độ xem mới không cần chụp?

Đào tạo 2D quy mô lớn truyền đạt kiến ​​thức tiềm ẩn về cách các vật thể xuất hiện trong 3D, việc tinh chỉnh giúp có thể kiểm soát được thông qua tư thế máy ảnh.

Tập dữ liệu nào về các đối tượng 3D là trọng tâm trong quá trình đào tạo Zero-1-to-3?

Nó được đào tạo trên bộ ba hình ảnh-tư thế-hình ảnh được kết xuất từ ​​các bộ sưu tập đối tượng 3D tổng hợp lớn như Objaverse.

Chi tiết đẹp của hình ảnh nguồn được bảo tồn như thế nào trong thế hệ này?

Hình ảnh thô được nối kênh với phần tiềm ẩn nhiễu (cùng với việc nhúng CLIP cho ngữ nghĩa) để nhận dạng và chi tiết được đảm bảo.