視覺人工智慧指南

YOLO即時檢測

YOLO(You Only Look Once)是一系列物件偵測模型,可透過單一神經網路通道找到並標記影像中的每個對象,速度足以滿足即時視訊的需求。

閱讀時間約2分鐘最後更新

概述

它的高速解鎖了從無人機到自助結帳機的即時視覺。

深入探討

在 YOLO 之前,R-CNN 等偵測器在影像區域上運行分類器數千次,速度很慢。 YOLO 由 Joseph Redmon 於 2015 年推出,將檢測重新定義為回歸問題:將圖像劃分為網格,並在單次前向傳遞中為每個單元預測邊界框、目標分數和類別機率。這種「一次性」設計使其比兩級探測器快得多,同時保持準確。該系列透過許多版本(YOLOv2 到 YOLOv8 及更高版本)快速發展,添加了錨框、更好的主幹和無錨頭。現代變體在 GPU 上的運行速度遠遠超過每秒 100 幀,這使得 YOLO 在延遲與準確性同樣重要時成為預設選擇。

技術洞察

YOLO 將影像分割成 S by S 網格。每個單元格都會一次預測一組固定的邊界框(x、y、寬度、高度)、置信度分數和類別機率。重疊的重複框透過非極大值抑制進行修剪,保留最高置信度的框並丟棄高於 IoU 閾值的其他框。損失聯合優化了框架座標、物件性和分類,因此整個偵測器進行端到端訓練。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

YOLO即時檢測的未來

YOLO 一直傾向於邊緣部署,較小的量化模型可以在手機、微控制器和嵌入式相機上運行,無需雲端連接。較新版本的混合變壓器組件和無錨設計可在不犧牲速度的情況下提高準確性。預計與追蹤和分割、開放詞彙檢測(從文字提示而不是固定標籤識別對象)進行更緊密的集成,並繼續專注於在邊緣的廉價、低功耗硬體上高效運行。

現實世界的實施

自助結帳系統和無收銀員商店在購物者取貨時檢測商品

無人機和農業機器人即時發現農作物、雜草或牲畜

交通和監視器可對車輛進行計數並偵測行人以進行智慧城市分析

生產線在快速移動的傳送帶上標記有缺陷的零件

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YOLO Real-Time Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

即時語音代理

常見問題

什麼是 YOLO 即時偵測?

YOLO(You Only Look Once)是一系列物件偵測模型,可透過單一神經網路通道找到並標記影像中的每個對象,速度足以滿足即時視訊的需求。它的速度解鎖了從無人機到自助結帳亭等各種設備的即時視覺。

在此上下文中,縮寫詞 YOLO 代表什麼?

YOLO 代表“You Only Look Once”,反映出它在單一神經網路中偵測影像上的所有物件。

使 YOLO 比 R-CNN 等早期檢測器更快的關鍵創新是什麼?

YOLO 將偵測重新定義為影像網格上的一個回歸問題,取代了兩級偵測器緩慢的逐區域分類。

什麼技術可以刪除 YOLO 輸出中重複、重疊的邊界框?

非極大值抑制保留最高置信度框,並丟棄高於交集閾值的重疊框。

在最初的YOLO設計中,輸入影像是如何分割進行預測的?

YOLO 將影像分割成 S × S 網格,每個單元負責預測以其中中心的物件的框和類別機率。

每個網格單元與邊界框座標一起預測哪些數量?

每個單元預測框座標、客觀置信度得分和類別機率,所有這些都在一次前向傳遞中聯合進行。