HƯỚNG DẪN AI trực quan

Ước tính độ sâu âm thanh nổi

Ước tính độ sâu âm thanh nổi phục hồi khoảng cách của mọi thứ bằng cách so sánh hai chế độ xem camera lệch nhau một chút, giống như hai mắt của bạn.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It turns flat images into 3D distance maps that robots, cars, and phones rely on to understand space.

Lặn sâu

Ước tính độ sâu âm thanh nổi sử dụng hai camera cách nhau một khoảng cố định (đường cơ sở). Cùng một điểm trên thế giới nằm ở các vị trí nằm ngang hơi khác nhau trong hình ảnh bên trái và bên phải, và sự thay đổi đó được gọi là sự chênh lệch. Các vật thể ở gần dịch chuyển rất nhiều; những người ở xa hầu như không di chuyển. Độ sâu được tính bằng (tiêu cự x đường cơ sở)/độ chênh lệch, do đó độ sâu và độ chênh lệch có mối quan hệ nghịch đảo. Phần khó khăn là khớp các pixel giữa hai hình ảnh, đặc biệt là trên các bức tường trơn, các mẫu lặp lại hoặc các bề mặt phản chiếu nơi có nhiều pixel trông giống hệt nhau. Các phương pháp cổ điển như Semi-Global Matching quét dọc theo đường quét, trong khi các mạng sâu hiện đại như PSMNet và RAFT-Stereo tìm hiểu các tính năng phong phú và tinh chỉnh lặp đi lặp lại sự khác biệt, tạo ra độ sâu dày đặc, chính xác ngay cả ở những vùng phức tạp.

Hiểu biết kỹ thuật

Cả hai hình ảnh đều được chỉnh sửa lần đầu tiên để các điểm trùng khớp nằm trên cùng một hàng ngang, giảm việc tìm kiếm xuống một chiều. Khối lượng chi phí được xây dựng bằng cách kiểm tra sự chênh lệch của từng ứng cử viên cho từng pixel, đo lường mức độ phù hợp giữa các tính năng bên trái và bên phải. Các mạng tổng hợp khối lượng này bằng các kết cấu 3D hoặc các bản cập nhật định kỳ, sau đó xử lý các chênh lệch mềm để có được độ chính xác đến từng pixel phụ. Mối quan hệ nghịch đảo giữa chênh lệch và độ sâu có nghĩa là độ sâu ở xa vốn ồn ào hơn độ sâu gần.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của ước tính độ sâu âm thanh nổi

Mong đợi sự kết hợp chặt chẽ hơn giữa âm thanh nổi với LiDAR, radar và tín hiệu một mắt để hệ thống xuống cấp một cách nhẹ nhàng khi một cảm biến bị lỗi. Đào tạo tự giám sát và kết hợp dựa trên máy biến áp (học từ video thô không có chiều sâu thực tế cơ bản) đang cắt giảm nhu cầu về dữ liệu được dán nhãn đắt tiền. Hiệu quả trên thiết bị đang được cải thiện nhanh chóng, đưa âm thanh nổi theo thời gian thực vào máy bay không người lái, kính AR và robot giá rẻ. Máy ảnh sự kiện và các mẫu hoạt động đã học hứa hẹn độ sâu đáng tin cậy ngay cả trong điều kiện ánh sáng yếu, chuyển động mờ và cảnh không có kết cấu đánh bại các phương pháp ngày nay.

Triển khai trong thế giới thực

Hệ thống tự lái và hỗ trợ người lái sử dụng camera âm thanh nổi để đo khoảng cách với ô tô, người đi bộ và lề đường để phanh và giữ làn đường.

Robot kho hàng và nông nghiệp xây dựng bản đồ 3D để nắm bắt đồ vật, tránh chướng ngại vật và hái trái cây ở độ sâu phù hợp.

Tai nghe AR/VR như thiết bị truyền qua ước tính hình dạng phòng để các vật thể ảo nằm chính xác trên bề mặt thực.

Xe thám hiểm sao Hỏa (ví dụ: Sự kiên trì) sử dụng camera điều hướng âm thanh nổi để lên kế hoạch cho những con đường an toàn trên địa hình nhiều đá mà không cần GPS.

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stereo Depth Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Ước tính độ sâu khuếch tán cúc vạn thọ

Câu hỏi thường gặp

What is Stereo Depth Estimation?

Ước tính độ sâu âm thanh nổi phục hồi khoảng cách của mọi thứ bằng cách so sánh hai chế độ xem camera lệch nhau một chút, giống như hai mắt của bạn. Nó biến hình ảnh phẳng thành bản đồ khoảng cách 3D mà robot, ô tô và điện thoại dựa vào để hiểu không gian.

'Sự chênh lệch' trong tầm nhìn âm thanh nổi là gì?

Sự chênh lệch là khoảng cách một điểm tương ứng di chuyển theo chiều ngang giữa hai chế độ xem được chỉnh sửa; sự chênh lệch lớn hơn có nghĩa là vật thể ở gần hơn.

Độ sâu liên quan đến sự chênh lệch như thế nào?

Độ sâu = (tiêu cự x đường cơ sở) / chênh lệch, do đó, khi độ chênh lệch giảm xuống, độ sâu ước tính sẽ tăng lên. Các vật thể ở xa có sự chênh lệch rất nhỏ.

Tại sao hình ảnh được 'chỉnh sửa' trước khi khớp?

Việc chỉnh sửa sẽ làm cong cả hai hình ảnh để các kết quả trùng khớp được giới hạn trong một đường ngang, biến tìm kiếm 2D thành tìm kiếm 1D nhanh.

Trường hợp nào khó nhất để khớp âm thanh nổi?

Các bề mặt không có kết cấu hoặc lặp đi lặp lại làm cho nhiều pixel trông giống hệt nhau, do đó thuật toán không thể tự tin tìm ra kết quả khớp chính xác.

'Đường cơ sở' đề cập đến điều gì?

Đường cơ sở là khoảng cách giữa hai tâm camera; đường cơ sở rộng hơn sẽ cải thiện độ chính xác cho các vật thể ở xa.