特征金字塔网络
特征金字塔网络(FPN)让探测器通过廉价地构建多尺度特征“金字塔”来发现尺寸截然不同的物体。
概述
They are the reason modern detectors find both a tiny faraway pedestrian and a huge nearby truck in the same image.
深入探讨
图像中的对象以多种尺度出现,单个特征图很难处理所有这些尺度。旧的方法通过多次调整照片大小并在每个副本上运行网络来构建图像金字塔,这很慢。 FPN,由 Lin 等人提出。 2017 年,转而重用卷积网络中已有的自然金字塔。像 ResNet 这样的主干网生成的特征图在网络中变得更小、语义更深入。 FPN 增加了一条自上而下的路径:它对深层、语义丰富的特征进行上采样,并通过横向连接将它们与浅层、高分辨率的特征合并。结果是一组语义强大但保留精细空间细节的特征图,几乎无需额外成本即可显着改善小物体检测。
技术洞察
FPN 具有自下而上的路径(主干)和自上而下的路径。每个自上而下的级别都进行 2x(最近邻)上采样,并按元素添加到匹配分辨率的 1x1 卷积横向特征图。然后,3x3 卷积平滑每个合并的贴图以减少锯齿。这会产生具有固定通道数(通常为 256)的 P2-P5 级别,每个级别的任务是检测特定比例范围的对象。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
特征金字塔网络的未来
FPN 自上而下的设计催生了许多后继者:PANet 添加了自下而上的路径,BiFPN(在 EfficientDet 中使用)通过加权连接使融合可学习且双向,NAS-FPN 自动搜索融合拓扑。像 DETR 这样的 Transformer 检测器避开了显式金字塔,但多尺度融合仍然是核心。预计 FPN 风格的想法将持续存在于视觉转换器和高效的设备检测器中,越来越多地采用学习的、自适应的比例加权而不是固定的连接。
现实世界的实施
在自动驾驶汽车感知堆栈中同时检测远处的小型行人和附近的大型车辆
为 Mask R-CNN 中的实例分割提供支持,其中 FPN 将多尺度特征提供给区域提议和掩模头
在医学成像检测管道中发现大型器官旁边的微小肿瘤
在卫星和航空图像中查找从小船到大型建筑物的不同尺寸的物体
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Feature Pyramid Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Feature Pyramid Networks?
特征金字塔网络(FPN)让探测器通过廉价地构建多尺度特征“金字塔”来发现尺寸截然不同的物体。这就是现代探测器在同一张图像中同时发现远处的微小行人和附近的巨大卡车的原因。
特征金字塔网络主要解决什么核心问题?
FPN 构建了多尺度特征表示,因此检测器可以一次性处理从小到大的物体。
在FPN中,自顶向下路径的作用是什么?
自上而下的路径对深层语义特征进行上采样,并将其与较浅的高分辨率地图合并,因此每个级别都既详细又语义强大。
横向连接通常如何与上采样的自上而下特征相结合?
1x1 卷积调整横向特征图的通道数,然后将其按元素添加到 2 倍上采样的自上而下特征中。
为什么 FPN 中每个合并的特征图都应用 3x3 卷积?
在逐元素相加之后,3x3 卷积减少了上采样引入的混叠伪影,从而产生更清晰的金字塔级别。
哪个后来的架构通过可学习的加权双向融合扩展了 FPN?
BiFPN 是随 EfficientDet 引入的,它使特征融合成为双向的,并学习每个输入的贡献强度的权重。