Phân đoạn toàn cảnh
Phân đoạn toàn cảnh cung cấp cho mỗi pixel trong hình ảnh một nhãn, thống nhất 'vùng này là gì' với 'đối tượng cụ thể này là gì'. Đây là hình thức hiểu biết cảnh đầy đủ nhất trong thị giác máy tính.
Lặn sâu
Tầm nhìn máy tính từ lâu đã có hai nhiệm vụ riêng biệt. Phân đoạn ngữ nghĩa gắn nhãn từng pixel theo danh mục (đường, bầu trời, con người) nhưng không thể phân biệt hai người. Phân đoạn phiên bản tìm và phác thảo các đối tượng có thể đếm được riêng lẻ nhưng bỏ qua những 'thứ' nền như bầu trời hoặc cỏ. Phân đoạn toàn cảnh, được chính thức hóa bởi các nhà nghiên cứu AI của Facebook vào năm 2018, hợp nhất cả hai: nó chỉ định mỗi pixel một danh mục và đối với những 'thứ' có thể đếm được, nó cũng chỉ định một ID phiên bản duy nhất. Kết quả là một bản đồ mạch lạc duy nhất không có khoảng trống hoặc chồng chéo. Chất lượng được đo bằng Chất lượng Panoptic (PQ), kết hợp mức độ chính xác của các vùng được nhận dạng với mức độ phù hợp giữa các ranh giới của chúng. Điều cần thiết là ở bất cứ nơi nào máy móc phải hiểu toàn bộ khung cảnh, chẳng hạn như ô tô tự lái diễn giải đường phố.
Hiểu biết kỹ thuật
Các mô hình toàn cảnh chia nhãn thành 'vật' (các đối tượng có thể đếm được như ô tô và con người, có ID phiên bản) và 'thứ' (các vùng vô định hình như đường hoặc bầu trời, không có ID). Các hệ thống ban đầu chạy các nhánh ngữ nghĩa và nhánh phiên bản riêng biệt, sau đó kết hợp chúng với các quy tắc để giải quyết xung đột pixel. Các phương pháp dựa trên máy biến áp mới hơn như Mask2Former dự đoán trực tiếp một bộ mặt nạ có nhãn lớp được liên kết, xử lý cả sự vật và nội dung trong một kiến trúc thống nhất.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của phân khúc toàn cảnh
Lĩnh vực này đang hợp nhất xung quanh các kiến trúc biến áp dựa trên truy vấn, thống nhất để xử lý các nhiệm vụ ngữ nghĩa, phiên bản và toàn cảnh bằng một mô hình. Nghiên cứu đang hướng tới phân đoạn toàn cảnh video giúp giữ cho danh tính cá thể nhất quán trên các khung, mô hình từ vựng mở giúp phân đoạn các danh mục được mô tả trong văn bản và các mô hình nhẹ hơn, đủ hiệu quả cho rô-bốt và phương tiện. Dữ liệu đào tạo tổng hợp tốt hơn và khả năng tự giám sát đang giảm chi phí lớn cho chú thích thủ công hoàn hảo đến từng pixel.
Triển khai trong thế giới thực
Xe tự hành xây dựng bản đồ cấp pixel hoàn chỉnh để phân biệt từng ô tô, người đi bộ, đường và vỉa hè
Hình ảnh y tế đánh dấu các vùng cơ quan trong khi đếm các tổn thương hoặc tế bào riêng lẻ
Các ứng dụng thực tế tăng cường tách biệt mọi vật thể và bề mặt để đặt nội dung ảo một cách thực tế
Hệ thống robot phân tích đầy đủ khung cảnh lộn xộn để lập kế hoạch nắm bắt và điều hướng
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Panoptic Segmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Phân đoạn hình ảnh
Câu hỏi thường gặp
What is Panoptic Segmentation?
Phân đoạn toàn cảnh cung cấp cho mỗi pixel trong hình ảnh một nhãn, thống nhất 'vùng này là gì' với 'đối tượng cụ thể này là gì'. Đây là hình thức hiểu biết cảnh đầy đủ nhất trong thị giác máy tính.
Phân đoạn toàn cảnh gán cho mỗi pixel trong hình ảnh những gì?
Phân đoạn toàn cảnh gắn nhãn cho mỗi pixel bằng một danh mục và ngoài ra còn cung cấp cho 'những thứ' có thể đếm được một ID phiên bản duy nhất, không để lại khoảng trống hoặc chồng chéo.
Trong thuật ngữ toàn cảnh, các lớp 'công cụ' là gì?
'Nội dung' đề cập đến các vùng nền vô định hình, không thể đếm được, chẳng hạn như bầu trời hoặc con đường, nhận được danh mục nhưng không có ID phiên bản.
Hạn chế chính của phân đoạn ngữ nghĩa mà phân đoạn toàn cảnh khắc phục là gì?
Phân đoạn ngữ nghĩa gắn nhãn pixel theo danh mục nhưng không thể tách hai người khỏi nhau; panoptic thêm danh tính cá thể.
Số liệu nào được sử dụng để đánh giá chất lượng phân đoạn toàn cảnh?
Chất lượng toàn cảnh (PQ) kết hợp độ chính xác của nhận dạng với sự chồng chéo phân đoạn để đánh giá mức độ dự đoán của mọi thứ và nội dung.
Các lớp 'thứ' nhận được gì mà các lớp 'thứ' không nhận được?
'Những thứ' có thể đếm được sẽ có một ID phiên bản duy nhất để có thể phân biệt các đối tượng riêng lẻ, trong khi 'thứ' chỉ có một danh mục.