開放詞彙目標偵測
開放詞彙對象偵測允許模型尋找並框出由任意文字描述的對象,包括在訓練期間從未見過的標記類別。
概述
It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.
深入探討
經典偵測器在一組封閉的類別上進行訓練,例如 COCO 中的 80 個類別,並且無法識別該清單之外的「事物」。開放詞彙偵測透過將視覺區域特徵與共享視覺語言嵌入空間對齊來打破這一限制,通常從大量圖像文字對中學習(如 CLIP)。在推理時,您提供文字標籤,模型嵌入這些標籤,並將檢測到的區域與最接近的文字嵌入相匹配,因此只要您可以描述新的類別,它們就可以工作。 ViLD、GLIP、OWL-ViT、Detic 和 Grounding DINO 等系統透過將偵測主幹與語言基礎結合以及透過對大型、弱標記或基礎資料集進行訓練來普及此方法。
技術洞察
訣竅是用文字嵌入替換固定的分類器層。偵測器不是為每個已知類別學習一個權重向量,而是將每個區域投影到與語言編碼器相同的空間中;分類變成區域特徵與使用者提供的類別名稱或短語的嵌入之間的相似性比較。由於文字編碼器可以泛化到未見過的單詞,因此在測試時交換新的標籤字串可以檢測邊界框訓練資料中缺少的類別。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
開放詞彙目標偵測的未來
開放詞彙檢測正在與基礎和分割相融合,其中自由格式短語(不僅僅是單字)定位對象,並與提示系統結合模型(例如用於掩模的 SAM)。期望更強的零射擊精度、更長、更具組合性的文字查詢(「筆記型電腦後面的紅色杯子」),以及與按需檢測的多模式助手的緊密耦合。隨著網路規模的圖像文字訓練的改進,檢測、檢索和語言理解之間的界限將朝著一般視覺基礎不斷模糊。
現實世界的實施
透過輸入名稱來搜尋圖像中的稀有或自訂對象,無需重新訓練
機器人系統在抓取使用者以自然語言命名的物品之前對其進行定位
透過從文字清單中偵測許多新類別來自動標記資料集
內容審核,標記原始訓練標籤中不存在的描述對象
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Open-Vocabulary Object Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Open-Vocabulary Object Detection?
開放詞彙對象偵測允許模型尋找並框出由任意文字描述的對象,包括在訓練期間從未見過的標記類別。這很重要,因為傳統的偵測器被鎖定到固定的類別列表,而開放詞彙模型可以偵測幾乎任何你能命名的東西。
開放詞彙目標偵測的定義能力是什麼?
開放詞彙檢測可以在測試時本地化由文本指定的類別,甚至是從未見過的用邊界框標記的類別。
這些模型如何對偵測到的區域進行分類?
他們將區域投影到視覺語言嵌入空間中,並將每個區域與最接近的文字標籤嵌入相匹配。
哪種預訓練資源最能達到開放詞彙檢測?
大量圖像文字資料(由 CLIP 樣式模型使用)建構了共享嵌入空間,使文字能夠泛化到新類別。
與閉式檢測器相比,更換了哪個部件?
分類不是使用固定的類別權重向量,而是使用與文字嵌入的相似性,因此可以在測試時添加新的標籤字串。
下列哪一個是開放詞彙或基礎檢測模型的範例?
接地 DINO 以及 GLIP、OWL-ViT、ViLD 和 Detic 都是眾所周知的開放詞彙或接地偵測器。