光流
光流估计每个像素如何在连续视频帧之间移动,产生运动矢量的密集图。
概述
It is how machines perceive movement, speed, and direction in video.
深入探讨
光流为每个像素分配一个微小的运动箭头,描述它从一帧到下一帧的移动位置。经典方法基于“亮度恒定”假设(一个点在移动时保持相同的亮度)并结合平滑度约束,如 Lucas-Kanade(稀疏)和 Horn-Schunck(密集)算法。这些对于小而轻柔的运动效果很好,但对于快速运动、遮挡和大的无纹理区域却很困难。深度学习改变了这个领域:FlowNet、PWC-Net,尤其是 RAFT 等网络学习跨帧匹配特征并迭代地细化流场。无论问题不仅仅是“帧中有什么?”,输出都会促进视频理解。但“它移动得怎么样?”
技术洞察
RAFT 是一种具有里程碑意义的方法,它构建了一个 4D“成本量”,对第一帧中的每个像素与第二帧中的每个像素的匹配程度进行评分,然后使用循环更新运算符 (GRU) 通过许多小步骤来细化流量估计,例如反复将箭头推向更好的匹配。这种迭代细化,而不是一次大的猜测,即使对于大位移和精细细节也能提供清晰、准确的流程,并且它可以很好地概括不同的场景。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
光流的未来
光流正在朝着边缘设备上的实时、高分辨率估计、与深度和 3D 场景流更紧密的集成,以及从原始视频中学习而无需昂贵的真实标签的自我监督训练发展。由于自主系统和机器人需要更丰富的运动理解,因此期望流与对象跟踪和预测相融合,这样机器不仅可以看到当前的运动,而且可以预测下一步的发展方向,即使是通过遮挡和快速的摄像机移动。
现实世界的实施
手机和运动相机中的视频稳定功能可消除手持运动的抖动
帧插值可生成帧之间的内容,使视频看起来更流畅或以慢动作运行
驾驶辅助和自动驾驶车辆估计附近汽车和行人的速度和方向
视频压缩编解码器预测帧之间的运动以更有效地存储视频
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Flow quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Optical Flow?
光流估计每个像素如何在连续视频帧之间移动,产生运动矢量的密集图。这是机器感知视频中的运动、速度和方向的方式。
光流实际上估计了什么?
光流产生运动向量,描述每个像素如何从一帧移动到下一帧。
经典光流中使用的“亮度恒定性”假设是什么?
经典方法假设物理点的亮度在移动时保持恒定,这使它们可以在帧之间进行匹配。
哪种现代深度学习方法以使用成本量和循环更新的迭代流程细化而闻名?
RAFT 构建 4D 成本量,并使用循环算子通过许多小步骤来细化流程,从而实现最先进的精度。
为什么经典的光流方法难以应对大而快速的运动?
当像素在帧之间跳跃很远时,基于小运动假设的方法就会失去跟踪,从而导致错误。
哪个应用程序直接依赖于估计帧之间的运动?
帧插值使用估计的像素运动合成中间帧,产生更平滑或慢动作的视频。