Độ sâuBất cứ thứ gìĐộ sâu một mắt
DepthAnything là mô hình nền tảng ước tính khoảng cách giữa mỗi pixel với một bức ảnh thông thường mà không cần phần cứng đặc biệt.
Tổng quan
It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.
Lặn sâu
DepthAnything (2024, được phát hành bởi các nhà nghiên cứu bao gồm cả những người ở TikTok/ByteDance và HKU) giải quyết vấn đề ước tính độ sâu bằng một mắt: dự đoán bản đồ độ sâu từ một hình ảnh RGB. Bước đột phá của nó nằm ở quy mô: thay vì chỉ dựa vào dữ liệu độ sâu được gắn nhãn hạn chế hiện có, nhóm đã xây dựng một công cụ tự động gắn nhãn cho khoảng 62 triệu bức ảnh chưa được gắn nhãn bằng cách sử dụng mô hình giáo viên, sau đó đào tạo một học sinh về kho dữ liệu khổng lồ này. Điều này mang lại khả năng tổng quát hóa không ảnh rõ ràng cho các cảnh trong nhà, ngoài trời và bất thường. Độ sâu tương đối đầu ra ban đầu (pixel nào gần hoặc xa hơn, không phải mét chính xác). DepthAnything V2 (giữa năm 2024) mài giũa các chi tiết nhỏ bằng cách đào tạo giáo viên về dữ liệu tổng hợp với độ chân thực hoàn hảo, sau đó chắt lọc thành hình ảnh thật, sửa lỗi viền mờ và lỗi vật thể trong suốt.
Hiểu biết kỹ thuật
Nó sử dụng bộ mã hóa biến đổi thị giác DINOv2 cung cấp đầu dự đoán dày đặc kiểu DPT. Bí quyết chính là quá trình chưng cất bán giám sát: một giáo viên được đào tạo về dữ liệu được gắn nhãn giả cho hàng triệu hình ảnh không được gắn nhãn và một học sinh học từ cả hai. V2 hoán đổi các nhãn thực ồn ào để lấy dữ liệu tổng hợp với độ sâu pixel hoàn hảo, sau đó chắt lọc trở lại ảnh thực, loại bỏ sự khan hiếm và nhiễu của các chú thích độ sâu thực trong khi vẫn giữ được ranh giới rõ ràng.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của độ sâuBất cứ thứ gìĐộ sâu một mắt
Mong đợi sự tích hợp chặt chẽ hơn vào kính AR, máy ảnh trên điện thoại thông minh và robot, nơi LiDAR chuyên dụng quá đắt hoặc cồng kềnh. Các biến thể số liệu tạo ra số liệu đo thực, cùng với các mô hình video có độ sâu ổn định theo thời gian (không nhấp nháy giữa các khung hình), đang phát triển nhanh chóng. Khi các mô hình này thu nhỏ lại để chạy trên thiết bị trong thời gian thực, nhận thức 3D bằng một camera sẽ trở thành khả năng mặc định, cung cấp khả năng tính toán không gian, điều hướng tự động và tái tạo cảnh 3D tổng hợp.
Triển khai trong thế giới thực
Tạo bản đồ độ sâu để làm mờ hậu cảnh thực tế (bokeh) trong ảnh chân dung trên điện thoại thông minh ống kính đơn.
Cung cấp khả năng nhận biết chướng ngại vật 3D cho máy bay không người lái và robot giá rẻ thiếu LiDAR hoặc camera âm thanh nổi.
Tạo bản đồ điều hòa độ sâu cho ControlNet để trình tạo hình ảnh bảo toàn hình dạng cảnh.
Chuyển đổi ảnh và phim 2D thành hiệu ứng 3D hoặc thị sai cho màn hình VR và lập thể.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DepthAnything Monocular Depth quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Ước tính độ sâu bằng một mắt
Câu hỏi thường gặp
What is DepthAnything Monocular Depth?
DepthAnything là mô hình nền tảng ước tính khoảng cách giữa mỗi pixel với một bức ảnh thông thường mà không cần phần cứng đặc biệt. Nó làm cho cảm biến độ sâu đa năng, mạnh mẽ trở nên rẻ hơn và có thể truy cập được đối với mọi thứ từ điện thoại đến robot.
Ước tính độ sâu 'một mắt' có nghĩa là gì?
Một mắt có nghĩa là độ sâu được suy ra từ một hình ảnh camera (đơn sắc), không có cặp âm thanh nổi hoặc cảm biến hoạt động.
Chiến lược chính của DepthAnything để đạt được khả năng khái quát hóa mạnh mẽ là gì?
Nhóm đã xây dựng một công cụ dữ liệu gắn nhãn giả cho hàng chục triệu bức ảnh chưa được gắn nhãn, mở rộng đáng kể quy mô đào tạo.
DepthAnything xây dựng trên bộ mã hóa xương sống nào?
DepthAnything sử dụng bộ mã hóa DINOv2 ViT được ghép nối với đầu dự đoán dày đặc kiểu DPT.
DepthAnything ban đầu chủ yếu tạo ra loại độ sâu nào?
Mô hình cơ sở dự đoán thứ tự độ sâu tương đối thay vì khoảng cách số liệu tuyệt đối.
DepthAnything V2 đã cải thiện chi tiết và các cạnh đẹp như thế nào?
V2 đào tạo giáo viên về hình ảnh tổng hợp có độ sâu chính xác, sau đó chắt lọc thành ảnh thật để ranh giới sắc nét hơn.