YOLO Phát hiện thời gian thực
YOLO (Bạn chỉ nhìn một lần) là một nhóm các mô hình phát hiện đối tượng có chức năng tìm và gắn nhãn cho mọi đối tượng trong hình ảnh chỉ bằng một lần truyền mạng thần kinh, đủ nhanh cho video trực tiếp.
Tổng quan
Its speed unlocked real-time vision on everything from drones to self-checkout kiosks.
Lặn sâu
Trước YOLO, các máy dò như R-CNN đã chạy bộ phân loại hàng nghìn lần trên các vùng hình ảnh, tốc độ này rất chậm. YOLO, được Joseph Redmon giới thiệu vào năm 2015, đã định hình lại khả năng phát hiện dưới dạng một vấn đề hồi quy: chia hình ảnh thành một lưới và dự đoán các hộp giới hạn cho mỗi ô, điểm đối tượng và xác suất của lớp trong một lần chuyển tiếp. Thiết kế 'nhìn một lần' đó khiến nó nhanh hơn đáng kể so với máy dò hai giai đoạn trong khi vẫn chính xác. Dòng này đã phát triển nhanh chóng qua nhiều phiên bản (YOLOv2 đến YOLOv8 trở lên), bổ sung thêm các hộp neo, xương sống tốt hơn và đầu không có neo. Các biến thể hiện đại chạy ở tốc độ hơn 100 khung hình/giây trên GPU, khiến YOLO trở thành lựa chọn mặc định khi độ trễ quan trọng ngang với độ chính xác.
Hiểu biết kỹ thuật
YOLO chia hình ảnh thành lưới S by S. Mỗi ô dự đoán một tập hợp các hộp giới hạn cố định với (x, y, chiều rộng, chiều cao), điểm tin cậy và xác suất của lớp, tất cả chỉ trong một lần vượt qua. Các hộp trùng lặp chồng chéo được cắt bớt bằng cách loại bỏ không tối đa, giúp giữ hộp có độ tin cậy cao nhất và loại bỏ các hộp khác trên ngưỡng IoU. Sự mất mát cùng nhau tối ưu hóa tọa độ hộp, tính đối tượng và phân loại, do đó toàn bộ máy dò sẽ chạy từ đầu đến cuối.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của phát hiện thời gian thực YOLO
YOLO tiếp tục có xu hướng triển khai biên, với các mô hình lượng tử hóa nhỏ hơn chạy trên điện thoại, bộ vi điều khiển và máy ảnh nhúng mà không cần kết nối đám mây. Các phiên bản mới hơn kết hợp các thành phần máy biến áp và thiết kế không có neo để mang lại độ chính xác mà không làm giảm tốc độ. Mong đợi sự tích hợp chặt chẽ hơn với tính năng theo dõi và phân đoạn, phát hiện từ vựng mở giúp nhận dạng các đối tượng từ lời nhắc văn bản thay vì nhãn cố định, đồng thời tiếp tục chú ý đến việc chạy hiệu quả trên phần cứng giá rẻ, tiêu thụ điện năng thấp ở biên.
Triển khai trong thế giới thực
Hệ thống tự thanh toán và các cửa hàng không thu ngân phát hiện các mặt hàng khi người mua hàng đến lấy
Máy bay không người lái và robot nông nghiệp phát hiện cây trồng, cỏ dại hoặc vật nuôi trong thời gian thực
Camera giao thông và giám sát đếm phương tiện và phát hiện người đi bộ để phân tích thành phố thông minh
Dây chuyền sản xuất gắn cờ các bộ phận bị lỗi trên băng tải chuyển động nhanh
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YOLO Real-Time Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Đại lý giọng nói thời gian thực
Câu hỏi thường gặp
What is YOLO Real-Time Detection?
YOLO (Bạn chỉ nhìn một lần) là một nhóm các mô hình phát hiện đối tượng có chức năng tìm và gắn nhãn cho mọi đối tượng trong hình ảnh chỉ bằng một lần truyền mạng thần kinh, đủ nhanh cho video trực tiếp. Tốc độ của nó đã mở khóa tầm nhìn thời gian thực trên mọi thứ, từ máy bay không người lái đến ki-ốt tự thanh toán.
Từ viết tắt YOLO có nghĩa là gì trong bối cảnh này?
YOLO là viết tắt của 'Bạn chỉ nhìn một lần', phản ánh rằng nó phát hiện tất cả các đối tượng trong một mạng lưới thần kinh duy nhất truyền qua hình ảnh.
Sự đổi mới quan trọng đã giúp YOLO nhanh hơn các máy dò trước đó như R-CNN là gì?
YOLO đã định hình lại việc phát hiện dưới dạng một vấn đề hồi quy trên lưới hình ảnh, thay thế cho việc phân loại chậm theo từng vùng của máy dò hai giai đoạn.
Kỹ thuật nào loại bỏ các hộp giới hạn trùng lặp, chồng chéo trong đầu ra của YOLO?
Việc triệt tiêu không tối đa sẽ giữ hộp có độ tin cậy cao nhất và loại bỏ các hộp chồng chéo trên ngưỡng giao nhau trên liên kết.
Trong thiết kế YOLO ban đầu, hình ảnh đầu vào được phân chia như thế nào để dự đoán?
YOLO chia hình ảnh thành một lưới S by S và mỗi ô chịu trách nhiệm dự đoán các hộp và xác suất lớp cho các đối tượng được căn giữa trong đó.
Mỗi ô lưới dự đoán số lượng nào cùng với tọa độ hộp giới hạn?
Mỗi ô dự đoán tọa độ hộp, điểm tin cậy về tính đối tượng và xác suất của lớp, tất cả đều cùng nhau trong một lần chuyển tiếp.