視覺人工智慧指南

特徵金字塔網絡

特徵金字塔網路(FPN)讓探測器透過廉價地建構多尺度特徵「金字塔」來發現尺寸截然不同的物體。

閱讀時間約2分鐘最後更新

概述

They are the reason modern detectors find both a tiny faraway pedestrian and a huge nearby truck in the same image.

深入探討

影像中的物件以多種尺度出現,單一特徵圖很難處理所有這些尺度。舊的方法透過多次調整照片大小並在每個副本上運行網路來建立圖像金字塔,這很慢。 FPN,由 Lin 等人提出。 2017 年,轉而重用卷積網路中已有的自然金字塔。像 ResNet 這樣的主幹網路產生的特徵圖在網路中變得更小、語意更深入。 FPN 增加了一條自上而下的路徑:它對深層、語義豐富的特徵進行上採樣,並透過橫向連接將它們與淺層、高解析度的特徵合併。結果是一組語意強大但保留精細空間細節的特徵圖,幾乎無需額外成本即可顯著改善小物體偵測。

技術洞察

FPN 具有自下而上的路徑(主幹)和自上而下的路徑。每個自上而下的層級都進行 2x(最近鄰)上採樣,並按元素添加到匹配分辨率的 1x1 卷積橫向特徵圖。然後,3x3 卷積平滑每個合併的貼圖以減少鋸齒。這會產生具有固定通道數(通常為 256)的 P2-P5 級別,每個級別的任務是偵測特定比例範圍的物件。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

特征金字塔网络的未来

FPN 自上而下的設計催生了許多後繼者:PANet 添加了自下而上的路徑,BiFPN(在 EfficientDet 中使用)透過加權連接使融合可學習且雙向,NAS-FPN 自動搜尋融合拓撲。像 DETR 這樣的 Transformer 偵測器避開了顯式金字塔,但多尺度融合仍然是核心。預計 FPN 風格的想法將持續存在於視覺轉換器和高效的設備檢測器中,越來越多地採用學習的、自適應的比例加權而不是固定的連接。

現實世界的實施

在自動駕駛汽車感知堆疊中同時偵測遠處的小型行人和附近的大型車輛

為 Mask R-CNN 中的實例分割提供支持,其中 FPN 將多尺度特徵提供給區域提議和掩模頭

在醫學影像檢測管道中發現大型器官旁的微小腫瘤

在衛星和航空圖像中尋找從小船到大型建築物的不同尺寸的物體

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Feature Pyramid Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

空間變換網絡

常見問題

What is Feature Pyramid Networks?

特徵金字塔網路(FPN)讓探測器透過廉價地建構多尺度特徵「金字塔」來發現尺寸截然不同的物體。這就是為什麼現代探測器在同一張圖像中同時發現遠處的微小行人和附近的巨大卡車的原因。

特徵金字塔網路主要解決什麼核心問題?

FPN 建構了多尺度特徵表示,因此偵測器可以一次處理從小到大的物體。

在FPN中,自頂向下路徑的作用是什麼?

自上而下的路徑對深層語義特徵進行上採樣,並將其與較淺的高分辨率地圖合併,因此每個級別都既詳細又語義強大。

橫向連接通常如何與上採樣的自上而下特徵結合?

1x1 卷積調整橫向特徵圖的通道數,然後將其按元素添加到 2 倍上採樣的自上而下特徵中。

為什麼 FPN 中每個合併的特徵圖都應用 3x3 卷積?

在逐元素相加之後,3x3 卷積減少了上採樣引入的混疊偽影,從而產生更清晰的金字塔層級。

哪個後來的架構透過可學習的加權雙向融合擴展了 FPN?

BiFPN 是隨 EfficientDet 引入的,它使特徵融合成為雙向的,並學習每個輸入的貢獻強度的權重。