YOLO实时检测
YOLO(You Only Look Once)是一系列对象检测模型,可通过单个神经网络通道查找并标记图像中的每个对象,速度足以满足实时视频的需要。
概述
Its speed unlocked real-time vision on everything from drones to self-checkout kiosks.
深入探讨
在 YOLO 之前,R-CNN 等检测器在图像区域上运行分类器数千次,速度很慢。 YOLO 由 Joseph Redmon 于 2015 年推出,将检测重新定义为一个回归问题:将图像划分为网格,并在单次前向传递中为每个单元预测边界框、目标分数和类别概率。这种“一次性”设计使其比两级探测器快得多,同时保持准确。该系列通过许多版本(YOLOv2 到 YOLOv8 及更高版本)快速发展,添加了锚框、更好的主干和无锚头。现代变体在 GPU 上的运行速度远远超过每秒 100 帧,这使得 YOLO 在延迟与准确性同样重要时成为默认选择。
技术洞察
YOLO 将图像分割成 S by S 网格。每个单元格一次性预测一组固定的边界框(x、y、宽度、高度)、置信度分数和类别概率。重叠的重复框通过非极大值抑制进行修剪,保留最高置信度的框并丢弃高于 IoU 阈值的其他框。损失联合优化了框坐标、对象性和分类,因此整个检测器进行端到端训练。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
YOLO实时检测的未来
YOLO 一直倾向于边缘部署,较小的量化模型可以在手机、微控制器和嵌入式相机上运行,无需云连接。较新版本的混合变压器组件和无锚设计可在不牺牲速度的情况下提高准确性。预计与跟踪和分割、开放词汇检测(从文本提示而不是固定标签识别对象)进行更紧密的集成,并继续关注在边缘的廉价、低功耗硬件上高效运行。
现实世界的实施
自助结账系统和无收银员商店在购物者取货时检测商品
无人机和农业机器人实时发现农作物、杂草或牲畜
交通和监控摄像头可对车辆进行计数并检测行人以进行智能城市分析
生产线在快速移动的传送带上标记有缺陷的零件
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YOLO Real-Time Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is YOLO Real-Time Detection?
YOLO(You Only Look Once)是一系列对象检测模型,可通过单个神经网络通道查找并标记图像中的每个对象,速度足以满足实时视频的需要。它的速度解锁了从无人机到自助结账亭等各种设备的实时视觉。
在此上下文中,缩写词 YOLO 代表什么?
YOLO 代表“You Only Look Once”,反映出它在单个神经网络中检测图像上的所有对象。
使 YOLO 比 R-CNN 等早期检测器更快的关键创新是什么?
YOLO 将检测重新定义为图像网格上的一个回归问题,取代了两级检测器缓慢的逐区域分类。
什么技术可以删除 YOLO 输出中重复、重叠的边界框?
非极大值抑制保留最高置信度框,并丢弃高于交集阈值的重叠框。
在最初的YOLO设计中,输入图像是如何划分进行预测的?
YOLO 将图像分割成 S × S 网格,每个单元负责预测以其中中心的对象的框和类概率。
每个网格单元与边界框坐标一起预测哪些数量?
每个单元预测框坐标、客观置信度得分和类别概率,所有这些都在一次前向传递中联合进行。