HƯỚNG DẪN AI trực quan

Âm thanh nổi nhiều chế độ xem

Âm thanh nổi nhiều chế độ xem (MVS) chụp nhiều ảnh đã được hiệu chỉnh của một cảnh và tạo ra bản tái tạo 3D dày đặc bằng cách ước tính độ sâu ở gần như mọi pixel.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It turns the sparse skeleton from Structure from Motion into detailed, surface-rich 3D models.

Lặn sâu

MVS giả định các tư thế của máy ảnh đã được biết đến (thường là từ Cấu trúc từ Chuyển động) và tập trung vào việc khôi phục hình học dày đặc. Nguyên tắc cốt lõi của nó là tính nhất quán của hình ảnh: một điểm bề mặt 3D được ước tính chính xác sẽ trông giống nhau khi được chiếu vào nhiều hình ảnh nhìn thấy nó. Các thuật toán kiểm tra độ sâu ứng cử viên cho từng pixel và chọn độ sâu nơi giao diện trên các chế độ xem phù hợp nhất, thường sử dụng kết hợp âm thanh nổi quét mặt phẳng hoặc kết hợp dựa trên bản vá (như trong phương pháp PMVS cổ điển). Bản đồ độ sâu trên mỗi hình ảnh sau đó được hợp nhất thành một đám mây điểm hoặc lưới thống nhất, giải quyết xung đột và lọc các ngoại lệ. Khó khăn chính là xử lý các điểm tắc, tường không có kết cấu và bề mặt phản chiếu. Các mạng MVS dựa trên học tập như MVSNet hiện xây dựng khối lượng chi phí và điều chỉnh chúng bằng các kết cấu 3D để có độ bền cao hơn.

Hiểu biết kỹ thuật

Tính nhất quán của ảnh là tín hiệu hướng dẫn: đối với độ sâu giả định, MVS sẽ chuyển các mảng hình ảnh từ các chế độ xem lân cận sang chế độ xem tham chiếu và đo lường mức độ phù hợp của chúng, thường có tương quan chéo được chuẩn hóa. Âm thanh nổi quét mặt phẳng chính thức hóa điều này bằng cách quét một mặt phẳng ảo qua độ sâu, tính toán chi phí phù hợp ở mỗi lớp và chọn độ sâu có sự đồng thuận mạnh nhất trong khi xử phạt các vùng bị che khuất hoặc có kết cấu thấp.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của âm thanh nổi đa chế độ xem

Học sâu đang định hình lại MVS: các mạng như MVSNet và các mạng kế nhiệm của nó tìm hiểu chi phí phù hợp và quy chuẩn hóa độ sâu từ đầu đến cuối, xử lý các bề mặt có kết cấu yếu và phản chiếu tốt hơn nhiều so với các phương pháp điều chỉnh bằng tay. Lĩnh vực này cũng đang hội tụ với kết xuất thần kinh - Gaussian Splatting và NeRF cung cấp các bản tái tạo dày đặc thay thế - đẩy MVS hướng tới độ trung thực cao hơn, thời gian chạy nhanh hơn và các mô hình số liệu chính xác cho AR, robot, bản sao kỹ thuật số và lập bản đồ thành phố 3D quy mô lớn.

Triển khai trong thế giới thực

Tạo các lưới 3D chi tiết, dày đặc của các tòa nhà và cảnh quan từ hình ảnh máy bay không người lái hoặc trên không

Tạo bản quét 3D có độ chính xác cao của các đối tượng và sản phẩm cho thương mại điện tử, trò chơi và VR

Xây dựng bản sao kỹ thuật số của các nhà máy, công trường phục vụ công tác kiểm tra và quy hoạch

Tái tạo địa hình và công trình chi tiết từ bộ sưu tập ảnh vệ tinh hoặc cấp đường phố

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-View Stereo quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Ước tính độ sâu âm thanh nổi

Câu hỏi thường gặp

What is Multi-View Stereo?

Âm thanh nổi nhiều chế độ xem (MVS) chụp nhiều ảnh đã được hiệu chỉnh của một cảnh và tạo ra bản tái tạo 3D dày đặc bằng cách ước tính độ sâu ở gần như mọi pixel. Nó biến bộ xương thưa thớt từ Cấu trúc từ Chuyển động thành các mô hình 3D chi tiết, giàu bề mặt.

Multi-View Stereo thường cho rằng điều gì đã được biết trước khi bắt đầu?

MVS dựa vào các vị trí camera đã được hiệu chỉnh, thường được cung cấp bởi Structure from Motion và tập trung vào độ sâu dày đặc.

MVS sử dụng nguyên tắc cốt lõi nào để tìm điểm 3D chính xác?

Một điểm bề mặt chính xác phải xuất hiện nhất quán khi được chiếu vào tất cả các hình ảnh quan sát nó.

MVS khác với đầu ra của Cấu trúc và Chuyển động như thế nào?

SfM mang lại một giàn giáo thưa thớt; MVS cô đặc nó thành các bề mặt chi tiết bao phủ gần như mọi pixel.

Âm thanh nổi quét mặt phẳng làm gì?

Nó kiểm tra nhiều độ sâu ứng viên bằng cách quét một mặt phẳng và tính toán chi phí phù hợp ở mỗi lớp.

Bề mặt nào đặc biệt thách thức đối với MVS?

Những bức tường trống thiếu những đặc điểm phù hợp và gương/bề mặt sáng bóng vi phạm tính nhất quán của ảnh, phá vỡ sự phù hợp tiêu chuẩn.