全景分割
全景分割為影像中的每個像素提供一個標籤,將「這個區域是什麼」與「這是哪個特定物件」統一起來。它是電腦視覺中最完整的場景理解形式。
深入探討
電腦視覺長期以來有兩個獨立的任務。語義分割以類別(道路、天空、人)標記每個像素,但無法區分兩個人。實例分割尋找並勾勒出單一可數對象,但忽略天空或草地等背景「東西」。 Facebook 人工智慧研究人員於 2018 年正式提出的全景分割將兩者融合在一起:它為每個像素分配一個類別,並且對於可數的“事物”,它還分配一個唯一的實例 ID。結果是一個沒有間隙或重疊的連貫地圖。品質透過全景品質 (PQ) 來衡量,它將區域識別的準確度與其邊界的匹配程度結合起來。當機器必須完全理解整個場景時,例如自動駕駛汽車解釋街道,這一點至關重要。
技術洞察
全景模型將標籤分為「事物」(可數對象,如汽車和人,可以獲得實例 ID)和「東西」(無定形區域,如道路或天空,但沒有)。早期的系統運行單獨的語義和實例分支,然後將它們與規則整合以解決像素衝突。較新的基於轉換器的方法(例如 Mask2Former)直接預測一組具有關聯類別標籤的掩碼,在一個統一的架構中處理事物和東西。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
全景分割的未來
這個領域正在圍繞著統一的、基於查詢的轉換器架構進行整合,這些架構可以使用一個模型處理語意、實例和全景任務。研究正在推動視訊全景分割,使實例身份在幀之間保持一致,開放詞彙模型分割文本中描述的類別,以及對機器人和車輛足夠高效的更輕模型。更好的合成訓練資料和自我監督正在降低像素完美手動註解的沉重成本。
現實世界的實施
自動駕駛車輛建立完整的像素地圖,區分每輛汽車、行人、道路和人行道
醫學影像可標記器官區域,同時對單一病變或細胞進行計數
擴增實境應用程式可將每個物件和表面分開,以真實放置虛擬內容
完全解析雜亂場景以規劃抓取和導航的機器人系統
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Panoptic Segmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Panoptic Segmentation?
全景分割為影像中的每個像素提供一個標籤,將「這個區域是什麼」與「這是哪個特定物件」統一起來。它是電腦視覺中最完整的場景理解形式。
全景分割為影像中的每個像素分配什麼?
全景分割以類別標記每個像素,並另外為可數的「事物」提供唯一的實例 ID,不留間隙或重疊。
用全景術語來說,什麼是「東西」類?
「東西」是指不可數的、無定形的背景區域,例如天空或道路,它們接收類別但沒有實例 ID。
全景分割克服的語意分割的主要限制是什麼?
語意分割依類別標記像素,但無法將兩個人分開;全景新增實例標識。
使用哪個指標來評估全景分割品質?
全景品質 (PQ) 將識別準確度與分割重疊相結合,對事物的預測效果進行評分。
「東西」類收到了哪些「東西」類沒有收到的訊息?
可數的「事物」獲得唯一的實例 ID,因此可以區分各個對象,而「事物」僅獲得一個類別。