視覺人工智慧指南

DETR 變壓器偵測

DETR(DEtection TRansformer)將目標偵測重新定義為使用變壓器解決的直接集合預測問題,消除了錨框和非極大值抑制等手工設計的步驟。

閱讀時間約2分鐘最後更新

概述

It matters because it gave detection a clean, end-to-end pipeline that inspired a wave of transformer-based vision models.

深入探討

DETR 由 Facebook AI 於 2020 年推出,將 CNN 主幹與 Transformer 編碼器-解碼器結合。 CNN提取圖像特徵;編碼器混合整個圖像的全局上下文;解碼器採用一組固定的學習“物件查詢”,並將每個查詢轉換為檢測到的物件(類別加邊界框)或“無物件”結果。關鍵的新穎之處在於二分匹配:在訓練期間,匈牙利演算法在預測和真實物件之間找到一對一的分配,因此模型學習直接為每個物件輸出一個唯一的框架。這消除了非極大值抑制和錨定調整。權衡是收斂速度慢和小物體精度較弱,Deformable DETR 等後續產品解決了這個問題。

技術洞察

DETR 的定義機制是匈牙利匹配的基於集合的損失。它不是對數千個錨框進行評分,而是發出固定數量的預測(通常是 100 個對象查詢),並將它們與真實對像一對一匹配,懲罰匹配對上的分類和框錯誤,並將不匹配的查詢推向“無對象”。由於匹配是一對一的,因此透過設計而不是單獨的後處理步驟來抑制重複檢測。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

DETR 變壓器偵測的未來

DETR 推出了全系列偵測變壓器。 Deformable DETR、DAB-DETR、DN-DETR 和 DINO 等變體極大地加快了訓練速度並提高了準確性,其中 DINO 型模型達到了檢測基準的最高水平。基於查詢的端到端範例現在擴展到分段、追蹤和 3D 偵測,並在此基礎上建立開放詞彙偵測器。預計檢測、分割和語言基礎將繼續整合到統一的轉換器架構中,DETR 被認為是消除手工啟發式方法的關鍵步驟。

現實世界的實施

在自動駕駛研究資料集中偵測和裝箱行人和車輛

當擴展到每像素掩模預測時,為全景分割提供動力

作為開放詞彙和接地探測器的骨幹架構

定位零售貨架圖像中的對象,無需調整每個資料集的錨點大小

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DETR Transformer Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

SwinIR 變壓器恢復

常見問題

What is DETR Transformer Detection?

DETR(DEtection TRansformer)將目標偵測重新定義為使用變壓器解決的直接集合預測問題,消除了錨框和非極大值抑制等手工設計的步驟。這很重要,因為它為檢測提供了一個乾淨的端對端管道,激發了基於 Transformer 的視覺模型的浪潮。

與 Faster R-CNN 等傳統偵測器相比,DETR 去除了什麼?

DETR 是端對端的,直接預測一組框,消除了錨點和非極大值抑制後處理步驟。

DETR 在訓練期間使用哪種演算法將預測與地面實況物件進行配對?

DETR 使用匈牙利演算法在預測和真實物件之間形成一對一的分配,以實現其集合損失。

DETR 的「物件查詢」是什麼?

物件查詢是固定數量的學習向量;解碼器將每個結果轉換為物件預測或「無物件」結果。

DETR結合了什麼整體架構?

DETR 將特徵的捲積主幹與用於集合預測的轉換器編碼器-解碼器配對。

為什麼DETR不需要非極大值抑制?

一對一配對損失教會模型為每個物件發出單一預測,因此不需要重複刪除後處理。