技術指南

擠壓和激勵網絡

擠壓和激勵(SE)區塊讓卷積網路了解每個特徵通道的權重,並根據全局上下文重新校準它們。

閱讀時間約2分鐘最後更新

概述

This cheap attention-like mechanism won the 2017 ImageNet competition and became a standard CNN building block.

深入探討

SE 模組由 Hu、Shen 和 Sun 於 2017 年提出,為 CNN 增加了明確通道關注。它分兩步驟進行。 「擠壓」使用全域平均池化將每個特徵圖(高度 x 寬度)折疊為單一數字,為每個通道產生一個描述符來總結其全域活化。 「激勵」透過兩個帶有瓶頸的小型全連接層(一個 ReLU,然後是一個 sigmoid)將該向量饋入,以產生 0 到 1 之間的每個通道權重。這些權重與原始特徵圖相乘,放大有用的通道並抑制不相關的通道。 SENet 贏得了 ILSVRC 2017 分類挑戰,將 top-5 錯誤率降低至約 2.25%。該區塊僅添加百分之幾的額外參數和計算,並以最小的變更插入 ResNet、Inception 或 MobileNet 中。

技術洞察

擠壓產生一個 C 長度向量 z,其中 z_c 是通道 c 的空間平均值。激勵計算 s = sigmoid(W2 * ReLU(W1 * z)),其中 W1 按縮減比率 r(通常為 16)減少維度,而 W2 恢復它,從而保持增加的成本很小。輸出是按通道按 s 縮放的輸入特徵圖。這是一種自我控制的形式:網路根據全球統計數據決定哪些管道對於該特定輸入很重要。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

擠壓和激勵網路的未來

SE 區塊存在於高效架構內部:EfficientNet 和 MobileNetV3 將它們嵌入到其建置區塊中。這個想法催生了一系列注意力模組,CBAM 增加了空間注意力,ECA-Net 用廉價的一維卷積取代了瓶頸,這些輕量級的重新校準技巧現在出現在檢測、分割,甚至一些視覺變換器混合中。只要卷積持續存在,預計通道注意力仍然是一個低成本的準確性槓桿。

現實世界的實施

SENet 透過將 SE 區塊添加到 ResNeXt 主幹網路贏得了 ImageNet ILSVRC 2017 分類挑戰賽

EfficientNet 和 MobileNetV3 在每個區塊中嵌入 SE 模組,以提高行動裝置上的準確性

物件偵測器和分割模型插入 SE 區塊以強調資訊豐富的特徵通道

ECA-Net 和 CBAM 透過更便宜或空間感知的通道重新校準擴展了 SE 概念

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Squeeze-and-Excitation Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Squeeze-and-Excitation Networks?

擠壓和激勵(SE)區塊讓卷積網路了解每個特徵通道的權重,並根據全局上下文重新校準它們。這種廉價的類注意力機制贏得了 2017 年 ImageNet 競賽,並成為標準的 CNN 構建塊。

SE 區塊中的「擠壓」步驟有什麼作用?

擠壓應用全域平均池化,將每個特徵圖折疊成每個通道的單一描述符。

「激勵」步驟輸出什麼?

激勵將壓縮向量傳遞通過兩個以 s 形曲線結尾的 FC 層,產生每個通道的縮放權重。

激勵權重如何應用於原始特徵圖?

每個通道的特徵圖乘以其學習的權重,放大或抑制該通道。

為什麼激勵使用具有減速比(通常為16)的瓶頸?

瓶頸縮小然後恢復通道尺寸,因此 SE 區塊的成本僅增加幾個百分點。

SENet 在 2017 年贏得了哪些比賽?

SENet 贏得了 ILSVRC 2017 影像分類挑戰賽,將 top-5 錯誤率推至約 2.25%。