視覺人工智慧指南

分段任何模型

分段任意模型 (SAM) 是 Meta AI 用於影像分割的基礎模型:給定點、框或粗略提示,它會立即勾勒出對應物件的輪廓。

閱讀時間約2分鐘最後更新

概述

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

深入探討

SAM 由 Meta AI 於 2023 年發布,將分段重新定義為一個可提示的問題:您給它一個提示(點擊、框、遮罩或文字衍生的提示),它會傳回一個或多個物件遮罩。它的力量部分來自於規模:它是在 SA-1B 上進行訓練的,SA-1B 是一個包含 1100 萬張圖像的超過 10 億個掩模的數據集,使用模型在環註釋引擎構建。在架構上,SAM 具有每個影像運行一次的重型影像編碼器、輕量級提示編碼器和快速遮罩解碼器,因此可以即時互動地重新提示單一嵌入影像。它可以零次遷移到許多任務。 2024 年發布的 SAM 2 將其擴展到視頻,跨幀追蹤對象。

技術洞察

SAM 使用 Vision Transformer (ViT) 影像編碼器(通常使用屏蔽自動編碼進行預訓練)來產生密集的影像嵌入。提示被編碼為標記,並且具有交叉注意熔絲的基於變壓器的解碼器將提示標記與圖像嵌入一起輸出掩碼和置信度分數。為了解決歧義(一次點擊可能意味著一個按鈕、一件襯衫或一個人),SAM 會同時預測幾個有效的遮罩並對它們進行排名,讓下游使用或額外的提示消除歧義。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

分段任意模型的未來

SAM 已成為註釋工具、醫學成像、機器人和 AR 管道的預設主幹,通常與開放詞彙「按名稱分段」工作流程的偵測器或文字模型配合使用。預計將有更輕、更快的變體(MobileSAM、EfficientSAM)用於設備上使用,與語言更深入地整合以實現完全文字驅動的分段,並持續擴展到視訊和 3D。作為基礎模型,它的嵌入越來越多地被重複使用為其他系統的感知層。

現實世界的實施

影像註解平台使用 SAM 讓標記器點擊一次並自動產生精確的物件遮罩,從而縮短標記時間。

研究人員採用 SAM(例如 MedSAM)在 CT 和 MRI 掃描中勾勒出器官和腫瘤的輪廓。

照片和影片編輯器整合了 SAM,只需單擊即可剪下主題或刪除背景。

SAM 2 跨視訊框架追蹤和分割對象,以實現 AR 效果和機器人感知。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

一致性模型

常見問題

What is Segment Anything Model?

分段任意模型 (SAM) 是 Meta AI 用於影像分割的基礎模型:給定點、框或粗略提示,它會立即勾勒出對應物件的輪廓。它的建構目的是泛化到訓練期間從未見過的物件和圖像,從而使分割成為一項快速的任務。

什麼樣的核心思想讓 SAM 成為細分的「基礎模型」?

SAM 將分割重新定義為可提示的,並設計用於零樣本傳輸到其訓練集之外的物件和影像。

用於訓練 SAM 的 SA-1B 資料集大約有多大?

SA-1B 在大約 1100 萬張圖像上包含超過 10 億個掩模,使用模型在環註釋引擎構建。

為什麼 SAM 將其架構分為重型影像編碼器和輕量級提示編碼器/解碼器?

昂貴的圖像編碼運行一次;然後,廉價的提示編碼和掩碼解碼允許對同一圖像進行快速、互動的重新提示。

SAM 如何處理不明確的提示,例如單擊一次可能表示多個物件?

SAM 輸出幾個帶有分數的候選掩碼,因此可以透過排名或附加提示來解決歧義。

SAM 使用哪種類型的主幹來編碼輸入影像?

SAM 的圖像編碼器是一個 Vision Transformer,通常使用屏蔽自動編碼進行預訓練,產生密集的圖像嵌入。