Dòng quang học
Luồng quang học ước tính cách mỗi pixel di chuyển giữa các khung hình video liên tiếp, tạo ra bản đồ dày đặc các vectơ chuyển động.
Tổng quan
It is how machines perceive movement, speed, and direction in video.
Lặn sâu
Luồng quang học gán một mũi tên chuyển động nhỏ cho mỗi pixel, mô tả vị trí nó dường như di chuyển từ khung hình này sang khung hình tiếp theo. Các phương pháp cổ điển dựa trên giả định 'độ sáng không đổi' - một điểm giữ nguyên độ sáng khi nó di chuyển - kết hợp với các ràng buộc về độ mịn, như trong thuật toán Lucas-Kanade (thưa thớt) và Horn-Schunck (dày đặc). Chúng hoạt động tốt với những chuyển động nhỏ, nhẹ nhàng nhưng lại gặp khó khăn với những chuyển động nhanh, những vùng bị tắc và những vùng không có kết cấu lớn. Học sâu đã thay đổi lĩnh vực này: các mạng như FlowNet, PWC-Net và đặc biệt là RAFT học cách khớp các tính năng trên các khung và tinh chỉnh lặp đi lặp lại trường luồng. Đầu ra thúc đẩy khả năng hiểu video ở bất cứ nơi nào câu hỏi không chỉ là 'cái gì trong khung hình?' nhưng 'nó di chuyển như thế nào?'
Hiểu biết kỹ thuật
RAFT, một cách tiếp cận mang tính bước ngoặt, xây dựng 'khối lượng chi phí' 4D để tính điểm xem mỗi pixel trong khung một khớp với từng pixel trong khung hai như thế nào, sau đó sử dụng toán tử cập nhật định kỳ (GRU) để tinh chỉnh ước tính luồng qua nhiều bước nhỏ — chẳng hạn như liên tục di chuyển các mũi tên hướng tới kết quả phù hợp hơn. Sự tinh chỉnh lặp đi lặp lại này, thay vì một dự đoán lớn, mang lại dòng chảy sắc nét, chính xác ngay cả đối với những chuyển vị lớn và chi tiết đẹp, đồng thời nó khái quát tốt trên các cảnh khác nhau.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của dòng quang
Luồng quang học đang hướng tới ước tính thời gian thực, độ phân giải cao trên các thiết bị biên, tích hợp chặt chẽ hơn với luồng chiều sâu và cảnh 3D, đồng thời đào tạo tự giám sát học từ video thô mà không cần nhãn thực tế đắt tiền. Vì các hệ thống tự động và robot đòi hỏi sự hiểu biết về chuyển động phong phú hơn, nên dòng chảy sẽ kết hợp với tính năng theo dõi và dự đoán đối tượng để máy móc không chỉ nhìn thấy chuyển động hiện tại mà còn dự đoán nơi mọi thứ sẽ diễn ra tiếp theo, thậm chí thông qua các vật cản và chuyển động nhanh của camera.
Triển khai trong thế giới thực
Ổn định video trong điện thoại và máy ảnh hành động giúp loại bỏ chuyển động cầm tay bị rung
Nội suy khung hình tạo ra các khung hình ở giữa để làm cho video trông mượt mà hơn hoặc chạy ở chế độ chuyển động chậm
Xe hỗ trợ người lái và xe tự lái ước tính tốc độ và hướng của xe ô tô và người đi bộ gần đó
Codec nén video dự đoán chuyển động giữa các khung hình để lưu trữ video hiệu quả hơn
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Flow quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Kết hợp dòng chảy
Câu hỏi thường gặp
What is Optical Flow?
Luồng quang học ước tính cách mỗi pixel di chuyển giữa các khung hình video liên tiếp, tạo ra bản đồ dày đặc các vectơ chuyển động. Đó là cách máy móc cảm nhận chuyển động, tốc độ và hướng trong video.
Dòng quang thực sự ước tính những gì?
Luồng quang học tạo ra các vectơ chuyển động mô tả cách mỗi pixel di chuyển từ khung hình này sang khung hình tiếp theo.
Giả định 'độ sáng không đổi' được sử dụng trong dòng quang học cổ điển là gì?
Các phương pháp cổ điển giả định độ sáng của một điểm vật lý không đổi khi nó di chuyển, điều này cho phép chúng khớp độ sáng giữa các khung hình.
Phương pháp học sâu hiện đại nào được biết đến với khả năng sàng lọc luồng lặp bằng cách sử dụng khối lượng chi phí và cập nhật định kỳ?
RAFT xây dựng khối lượng chi phí 4D và sử dụng toán tử định kỳ để tinh chỉnh luồng qua nhiều bước nhỏ, đạt được độ chính xác hiện đại.
Tại sao các phương pháp dòng quang học cổ điển lại gặp khó khăn với những chuyển động lớn và nhanh?
Các phương pháp được xây dựng dựa trên giả định chuyển động nhỏ sẽ mất dấu vết khi một pixel nhảy xa giữa các khung hình, gây ra lỗi.
Ứng dụng nào dựa trực tiếp vào việc ước tính chuyển động giữa các khung hình?
Nội suy khung hình tổng hợp các khung hình trung gian bằng cách sử dụng chuyển động pixel ước tính, tạo ra video chuyển động chậm hoặc mượt mà hơn.