Nhận dạng hành động
Nhận dạng hành động là nhiệm vụ dạy máy tính xác định những gì người hoặc vật thể đang *làm* trong video — chạy, vẫy tay, ngã, mở cửa — không chỉ những gì xuất hiện trong một khung hình duy nhất.
Tổng quan
It matters because understanding motion over time unlocks applications from sports analytics to elderly fall detection.
Lặn sâu
Nhận dạng hành động vượt xa việc phân loại hình ảnh tĩnh bằng cách suy luận về cách các pixel thay đổi theo thời gian. Một khung hình duy nhất có thể hiển thị một người đang ở giữa không trung; chỉ trình tự mới tiết lộ liệu họ đang nhảy, rơi hay lặn. Các tính năng chuyển động thủ công của các hệ thống ban đầu như dòng quang học và quỹ đạo dày đặc. Các phương pháp tiếp cận hiện đại sử dụng mạng sâu: kiến trúc hai luồng xử lý sự xuất hiện (khung RGB) và chuyển động (luồng quang) riêng biệt; Các mạng tích chập 3D (như C3D và I3D) trượt các bộ lọc qua không gian *và* thời gian; và các bộ chuyển đổi video (TimeSformer, VideoMAE) áp dụng sự chú ý trên các bản vá lỗi không gian-thời gian. Các điểm chuẩn tiêu chuẩn bao gồm Kinetics (700 lớp hành động của con người từ YouTube), UCF101 và Something-Something, buộc các mô hình phải hiểu hướng thời gian thay vì chỉ bối cảnh cảnh.
Hiểu biết kỹ thuật
Thách thức cốt lõi là mô hình hóa chiều hướng thời gian. Tích chập 3D mở rộng bộ lọc 2D thông thường với trục độ sâu trải rộng trên nhiều khung hình, do đó nó học trực tiếp các mẫu chuyển động. Thủ thuật I3D 'thổi phồng' các trọng số từ mạng hình ảnh 2D được huấn luyện trước trên ImageNet thành 3D bằng cách sao chép chúng theo thời gian, tạo ra một điểm khởi đầu chắc chắn. Thay vào đó, các phương pháp hai luồng sẽ đưa luồng quang được tính toán trước vào một nhánh riêng biệt, mã hóa rõ ràng chuyển động và sau đó kết hợp nó với các đặc điểm bề ngoài.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của sự công nhận hành động
Lĩnh vực này đang chuyển sang các công cụ chuyển đổi video hiệu quả và đào tạo trước tự giám sát (mô hình hóa video được che giấu) học hỏi từ các cảnh quay không được gắn nhãn, cắt giảm sự phụ thuộc vào các chú thích đắt tiền. Mong đợi sự tích hợp chặt chẽ hơn với các mô hình ngôn ngữ đa phương thức để hệ thống không chỉ có thể gắn nhãn hành động mà còn mô tả và lý giải về chúng bằng ngôn ngữ tự nhiên. Nhận dạng theo thời gian thực, trên thiết bị dành cho thiết bị đeo, robot và máy ảnh thông minh là một bước tiến lớn, bên cạnh khả năng nhận dạng chi tiết giúp phân biệt các chuyển động tinh tế, gần giống nhau.
Triển khai trong thế giới thực
Hệ thống phát hiện cú ngã trong viện dưỡng lão giúp cảnh báo nhân viên khi có người bị ngã, phân biệt ngã do ngồi hay nằm
Nền tảng phân tích thể thao tự động gắn thẻ các cú giao bóng, tắc bóng và cú đánh trong cảnh quay trận đấu để phục vụ các nội dung nổi bật về huấn luyện và phát sóng
Giám sát và giám sát an toàn nhằm phát hiện các hành vi bất thường như đánh nhau, lảng vảng hoặc ai đó trèo rào
Giao diện điều khiển bằng cử chỉ và ứng dụng thể dục đếm số lần lặp lại và kiểm tra hình thức tập thể dục bằng cách nhận dạng chuyển động của cơ thể theo thời gian
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Action Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Nhận dạng khuôn mặt
Câu hỏi thường gặp
What is Action Recognition?
Nhận dạng hành động là nhiệm vụ dạy máy tính xác định những gì người hoặc vật thể đang *làm* trong video — chạy, vẫy tay, ngã, mở cửa — không chỉ những gì xuất hiện trong một khung hình duy nhất. Điều này quan trọng vì hiểu được chuyển động theo thời gian sẽ mở khóa các ứng dụng từ phân tích thể thao đến phát hiện cú ngã ở người cao tuổi.
Điều gì phân biệt cơ bản nhận dạng hành động với phân loại hình ảnh thông thường?
Các mô hình nhận dạng hành động chuyển động trên một chuỗi khung hình, vì một hình ảnh tĩnh thường không thể tiết lộ liệu ai đó đang nhảy, rơi hay lặn.
Trong mạng nhận dạng hành động hai luồng cổ điển, luồng thứ hai thường xử lý những gì?
Kiến trúc hai luồng sử dụng một nhánh cho giao diện (khung RGB) và nhánh thứ hai cho luồng quang, mã hóa rõ ràng chuyển động giữa các khung.
Tích chập 3D bổ sung thêm gì so với tích chập 2D tiêu chuẩn?
Tích chập 3D mở rộng bộ lọc với chiều sâu/thời gian, cho phép nó tìm hiểu các mẫu chuyển động trực tiếp trên các khung hình liên tiếp.
Thủ thuật 'lạm phát' được mô hình I3D sử dụng là gì?
I3D 'tăng cường' các trọng số đã được huấn luyện trước trên hình ảnh 2D (như ImageNet) thành 3D bằng cách sao chép chúng dọc theo trục thời gian, mang lại khả năng khởi tạo mạnh mẽ.
Tại sao tập dữ liệu Something-Something đáng chú ý để nhận dạng hành động?
Something-Something được thiết kế sao cho hành động phụ thuộc vào trật tự và chuyển động theo thời gian, ngăn chặn các mô hình gian lận chỉ sử dụng hình nền hoặc hình dáng đối tượng.