視覺人工智慧指南

可變形卷積

可變形卷積讓神經網路彎曲其採樣網格以遵循物件的實際形狀,而不是強迫它通過剛性的方形視窗。

閱讀時間約2分鐘最後更新

概述

This makes models far better at handling odd shapes, scale changes, and geometric distortion.

深入探討

普通卷積以固定偏移量對像素進行採樣-以每個位置為中心的整齊的 3x3 網格。這對於紋理來說效果很好,但當物體傾斜、拉伸或形狀奇怪時就很困難了。 Dai 及其同事在 Microsoft Research 於 2017 年引入的可變形卷積為每個採樣點添加了一個小的學習偏移。網路查看輸入並預測每個網格位置的 2D 偏移,因此感受野可以扭曲以擁抱彎曲的邊緣或跟隨傾斜的肢體。可變形 RoI 池化將相同的想法應用於區域特徵。版本 2(2018)增加了每點調變權重,讓層抑製或放大每個樣本,從而提高了 COCO 等基準上的物件偵測精度。

技術洞察

偏移量由並行運行的額外卷積層產生,為 N 點內核輸出 2N 個值(每點一個 dx,一個 dy)。由於預測的偏移量是小數,因此採樣的像素值是透過雙線性插值計算的,這會使整個操作保持可微分。偏移量是透過正常的反向傳播端到端學習的——沒有單獨的監督告訴網路去哪裡尋找。增加的成本是適度的,因為偏移分支相對於主要特徵圖來說是輕量級的。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

可變形卷積的未來

可變形注意力已成為現代檢測的支柱:可變形 DETR 使用學習的採樣偏移量使 Transformer Attention 變得稀疏且快速,與原始 DETR 相比,大大縮短了訓練時間。預計可變形原理將繼續傳播到影片、3D 點雲和視覺語言模型中,其中自適應取樣有助於處理運動、遮蔽和不規則幾何形狀。隨著對不規則記憶體存取的硬體支援的改進,可變形算子也應該變得更便宜並且更廣泛地部署在邊緣設備上。

現實世界的實施

COCO 上的物體偵測,其中可變形層提高了火車和長頸鹿等細長或旋轉物體的準確性

街道場景的語義分割,幫助模型追蹤彎曲的車道標記和不規則的建築輪廓

用於端對端檢測的可變形 DETR,使用學習到的偏移量使 Transformer 注意力高效

醫學影像,其中腫瘤和器官具有非剛性形狀,固定網格捕捉效果較差

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deformable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

深度可分離卷積

常見問題

What is Deformable Convolutions?

可變形卷積讓神經網路彎曲其採樣網格以遵循物件的實際形狀,而不是強迫它通過剛性的方形視窗。這使得模型能夠更好地處理奇怪的形狀、比例變化和幾何扭曲。

與標準卷積相比,可變形卷積增加了什麼?

可變形卷積預測每個採樣位置的學習偏移(dx,dy),讓網格扭曲以符合物件形狀。

可變形卷積中的取樣偏移是如何產生的?

並行卷積分支輸出偏移量,這些偏移量是透過反向傳播端到端學習的。

由於預測的偏移通常是小數,因此如何在這些位置對像素值進行取樣?

分數偏移需要雙線性插值,這使訓練操作保持可微分。

Deformable ConvNets v2 (2018) 在原來的基礎上增加了什麼?

v2 引入了調製,即每個取樣點學習的權重,可以放大或抑制其影響,從而提高準確性。

為什麼可變形卷積對於不規則形狀的物體特別有用?

透過彎曲採樣網格,有效感受野與物體的幾何形狀而不是剛性的正方形對齊。