HƯỚNG DẪN AI trực quan

SLAM trực quan

Visual SLAM cho phép camera chuyển động xây dựng bản đồ về một không gian không xác định đồng thời theo dõi vị trí của chính nó bên trong bản đồ đó.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Nó là xương sống không gian của robot, máy bay không người lái, tai nghe AR và các tính năng tự lái.

Lặn sâu

SLAM là viết tắt của Bản đồ và Bản đồ hóa Đồng thời, và biến thể trực quan giải quyết nó bằng cách sử dụng máy ảnh thay vì (hoặc bên cạnh) lidar hoặc radar. Khi máy ảnh di chuyển, hệ thống sẽ phát hiện các đặc điểm đặc biệt như góc và cạnh, khớp chúng trên các khung hình và sử dụng chuyển động biểu kiến ​​của các điểm đó để ước tính cả cấu trúc 3D của cảnh và quỹ đạo của máy ảnh. Phần khó là sự kết hợp giữa con gà và quả trứng: bạn cần một bản đồ để biết mình đang ở đâu, nhưng bạn cần biết mình đang ở đâu để xây dựng bản đồ. Visual SLAM cùng nhau giải quyết vấn đề này, thường tinh chỉnh hàng nghìn điểm và tư thế cùng một lúc. Nó hỗ trợ ARKit, ARCore, khả năng theo dõi từ trong ra ngoài của Meta, tàu thám hiểm sao Hỏa và robot kho hàng, hoạt động trong nhà khi GPS không hoạt động.

Hiểu biết kỹ thuật

Một quy trình thông thường có mặt trước theo dõi các đối tượng từ khung này sang khung khác (sử dụng ORB, SIFT hoặc phương pháp trắc quang trực tiếp) và mặt sau giúp tối ưu hóa bản đồ. Việc điều chỉnh gói cùng nhau giảm thiểu lỗi chiếu lại trên nhiều tư thế máy ảnh và các điểm 3D, trong khi tính năng đóng vòng lặp sẽ phát hiện khi máy ảnh quay lại một địa điểm và điều chỉnh độ lệch tích lũy. SLAM một mắt không thể khôi phục tỷ lệ tuyệt đối, vì vậy máy ảnh âm thanh nổi hoặc thiết bị đo quán tính (IMU) được hợp nhất để khắc phục điều đó.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của SLAM trực quan

Lĩnh vực này đang chuyển từ kết hợp tính năng thủ công sang các tính năng đã học, độ sâu đã học và SLAM thần kinh từ đầu đến cuối mạnh mẽ hơn đối với các bức tường không có kết cấu, chuyển động mờ và ánh sáng thay đổi. Các trường bức xạ thần kinh và sự phân tán Gaussian đang được hợp nhất vào SLAM để tạo ra các bản đồ dày đặc, chân thực thay vì các đám mây điểm thưa thớt. Mong đợi sự kết hợp quán tính-thị giác chặt chẽ hơn trên điện thoại và tai nghe, cộng với SLAM ngữ nghĩa gắn nhãn các đối tượng, cho phép robot suy luận về một cảnh chứ không chỉ điều hướng hình học của nó.

Triển khai trong thế giới thực

Theo dõi vị trí từ trong ra ngoài trên tai nghe Meta Quest và Apple Vision Pro, định vị người dùng trong phòng không có trạm gốc bên ngoài

Apple ARKit và Google ARCore gắn đồ nội thất ảo hoặc nhân vật trò chơi vào sàn và bàn thực trên điện thoại

Xe thám hiểm sao Hỏa của NASA sử dụng phép đo hình ảnh và bản đồ để điều hướng địa hình nơi không có GPS

Robot kho tự động và robot giao hàng trong nhà xây dựng bản đồ sàn và định vị giữa các kệ

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

SLAM trực quan là gì?

Visual SLAM cho phép camera chuyển động xây dựng bản đồ về một không gian không xác định đồng thời theo dõi vị trí của chính nó bên trong bản đồ đó. Nó là xương sống không gian của robot, máy bay không người lái, tai nghe AR và các tính năng tự lái.

Từ viết tắt SLAM có nghĩa là gì?

SLAM có nghĩa là Bản đồ hóa và Bản đồ hóa Đồng thời: xây dựng bản đồ đồng thời tìm ra vị trí của bạn trong đó.

Tại sao SLAM hình ảnh một mắt (một camera) không thể tự phục hồi tỷ lệ tuyệt đối?

Với một camera và không có tín hiệu nào khác, một cảnh nhỏ ở gần và một cảnh lớn ở xa có thể trông giống hệt nhau, do đó thang đo hệ mét thực sự sẽ không rõ ràng nếu không có âm thanh nổi hoặc IMU.

Mục đích của việc đóng vòng lặp trong hệ thống SLAM là gì?

Các lỗi theo dõi nhỏ tích lũy theo thời gian dưới dạng trôi dạt; việc phát hiện camera đã quay trở lại một vị trí đã biết cho phép hệ thống điều chỉnh toàn bộ quỹ đạo.

Điều chỉnh gói tối ưu hóa điều gì ở phần sau SLAM?

Việc điều chỉnh gói cùng nhau tinh chỉnh nhiều vị trí camera và các điểm trên bản đồ sao cho các điểm 3D được chiếu phù hợp nhất ở nơi các đặc điểm thực sự xuất hiện trong ảnh.

Tại sao IMU (đơn vị đo quán tính) thường được kết hợp với camera trong SLAM trực quan?

Gia tốc kế và con quay hồi chuyển cung cấp các ước tính chuyển động giúp ổn định việc theo dõi thông qua chuyển động mờ và giúp phân giải tỷ lệ, điều mà một camera đơn lẻ không thể làm được.