HƯỚNG DẪN AI trực quan

Tổng hợp chế độ xem tiểu thuyết

Tổng hợp chế độ xem mới lạ tạo ra các hình ảnh chân thực về một cảnh từ các góc nhìn chưa bao giờ được chụp ảnh thực sự.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it turns a handful of photos into a fully explorable 3D scene, powering immersive media, VR, and digital twins.

Lặn sâu

Tổng hợp chế độ xem mới (NVS) lấy một tập hợp các hình ảnh đầu vào với các tư thế máy ảnh đã biết và hiển thị cảnh từ các vị trí máy ảnh mới, chưa được nhìn thấy. Thay vì xây dựng lại một lưới rõ ràng, NVS hiện đại thường học cách biểu diễn liên tục hình dáng và hình học của cảnh. Trường bức xạ thần kinh (NeRF) mã hóa cảnh dưới dạng chức năng ánh xạ vị trí 3D và hướng xem theo màu sắc và mật độ, sau đó tổng hợp các chế độ xem bằng cách di chuyển tia thể tích, các điểm lấy mẫu dọc theo từng tia của pixel và tích hợp chúng. 3D Gaussian Splatting thể hiện cảnh khi hàng triệu Gaussian 3D màu được phân loại theo thời gian thực. Cả hai đều nắm bắt được các hiệu ứng phụ thuộc vào chế độ xem như phản xạ và điểm nổi bật, tạo ra kết quả thực tế ấn tượng mà các quy trình dựa trên hình học truyền thống khó có thể sánh được.

Hiểu biết kỹ thuật

NeRF huấn luyện một mạng lưới thần kinh nhỏ hoàn toàn bằng giám sát trắc quang: đối với mỗi pixel huấn luyện, nó tạo ra một tia, lấy mẫu điểm 3D, truy vấn màu sắc và mật độ, rồi tổng hợp chúng thông qua tích phân hiển thị khối, sau đó truyền ngược sự khác biệt so với pixel thực. Mã hóa vị trí cho phép mạng thể hiện chi tiết tần số cao. Gaussian Splatting loại bỏ mạng mỗi tia để chuyển sang sử dụng Gaussian rõ ràng và rasterization có thể phân biệt, trao đổi bộ nhớ để đào tạo và hiển thị thời gian thực nhanh hơn nhiều.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của tổng hợp chế độ xem tiểu thuyết

NVS đang nhanh chóng trở nên nhanh hơn, có thể chỉnh sửa và năng động hơn. Các kỹ thuật như Instant-NGP cắt giảm thời gian đào tạo từ hàng giờ xuống còn vài giây, trong khi các phương pháp 4D mở rộng biểu tượng Gaussian sang các cảnh chuyển động. Mong đợi các mô hình tổng hợp tạo ảo giác cho các vùng không nhìn thấy hợp lý từ các hình ảnh thưa thớt hoặc đơn lẻ, tích hợp với hình đại diện chuyển văn bản thành 3D, đáng tin cậy và có thể hoạt hình cũng như truyền phát các trường tỏa sáng, khiến việc chụp thể tích trở nên thực tế cho phim, hiện diện từ xa, mô phỏng robot và AR dành cho người tiêu dùng.

Triển khai trong thế giới thực

Biến video trên điện thoại về một đối tượng thành cảnh 3D có thể khám phá cho thương mại điện tử hoặc các chuyến tham quan ảo

Tạo các bản phát lại theo thời gian và góc nhìn tự do trong thể thao và phim từ chế độ chụp nhiều camera

Xây dựng các bản sao kỹ thuật số giống như ảnh thực của các phòng và môi trường cho hướng dẫn thực tế ảo và bất động sản

Tạo môi trường và tài sản đào tạo cho mô phỏng robot và xe tự hành

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Novel View Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Khuếch tán chế độ xem tiểu thuyết từ 0 đến 3

Câu hỏi thường gặp

What is Novel View Synthesis?

Tổng hợp chế độ xem mới lạ tạo ra các hình ảnh chân thực về một cảnh từ các góc nhìn chưa bao giờ được chụp ảnh thực sự. Điều này quan trọng vì nó biến một số bức ảnh thành cảnh 3D có thể khám phá đầy đủ, cung cấp năng lượng cho phương tiện truyền thông sống động, VR và cặp song sinh kỹ thuật số.

Mục tiêu của việc tổng hợp quan điểm mới lạ là gì?

Tổng hợp chế độ xem mới tạo ra hình ảnh quang học từ các góc nhìn mới, chưa từng thấy bằng cách sử dụng một tập hợp các hình ảnh đầu vào với các tư thế đã biết.

Trường bức xạ thần kinh (NeRF) ánh xạ vị trí 3D và hướng nhìn tới cái gì?

NeRF học một chức năng từ (vị trí, hướng) đến màu sắc và mật độ phát ra, sau đó được tích hợp dọc theo các tia để hiển thị hình ảnh.

NeRF hiển thị pixel cho chế độ xem mới như thế nào?

Đối với mỗi pixel, NeRF tạo ra một tia, lấy mẫu các điểm 3D, truy vấn mạng về màu sắc/mật độ và kết hợp chúng với tích phân kết xuất khối.

Sự khác biệt chính về mặt biểu diễn của 3D Gaussian Splatting so với NeRF là gì?

Gaussian Splatting thể hiện cảnh bằng các nguyên hàm Gaussian 3D rõ ràng và khả năng rasterization có thể phân biệt, cho phép hiển thị thời gian thực nhanh hơn nhiều so với các truy vấn mạng mỗi tia của NeRF.

Tại sao các phương pháp NVS có thể tái tạo phản xạ và điểm sáng bóng?

Bằng cách điều chỉnh màu sắc theo hướng xem, các biểu tượng NeRF và Gaussian ghi lại các hiệu ứng phụ thuộc vào chế độ xem như điểm nổi bật và phản chiếu của gương.