分段任何模型
分段任意模型 (SAM) 是 Meta AI 用于图像分割的基础模型:给定点、框或粗略提示,它会立即勾勒出相应对象的轮廓。
概述
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
深入探讨
SAM 由 Meta AI 于 2023 年发布,将分段重新定义为一个可提示的问题:您给它一个提示(单击、框、掩码或文本衍生的提示),它会返回一个或多个对象掩码。它的力量部分来自于规模:它是在 SA-1B 上进行训练的,SA-1B 是一个包含 1100 万张图像的超过 10 亿个掩模的数据集,使用模型在环注释引擎构建。在架构上,SAM 具有每个图像运行一次的重型图像编码器、轻量级提示编码器和快速掩模解码器,因此可以实时交互式地重新提示单个嵌入图像。它可以零次迁移到许多任务。 2024 年发布的 SAM 2 将其扩展到视频,跨帧跟踪对象。
技术洞察
SAM 使用 Vision Transformer (ViT) 图像编码器(通常使用屏蔽自动编码进行预训练)来生成密集的图像嵌入。提示被编码为标记,并且具有交叉注意熔丝的基于变压器的解码器将提示标记与图像嵌入一起输出掩码和置信度分数。为了解决歧义(一次点击可能意味着一个按钮、一件衬衫或一个人),SAM 会同时预测几个有效的掩码并对它们进行排名,让下游使用或额外的提示消除歧义。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
分段任意模型的未来
SAM 已成为注释工具、医学成像、机器人和 AR 管道的默认主干,通常与开放词汇“按名称分段”工作流程的检测器或文本模型配合使用。预计将有更轻、更快的变体(MobileSAM、EfficientSAM)用于设备上使用,与语言更深入地集成以实现完全文本驱动的分段,并持续扩展到视频和 3D。作为基础模型,它的嵌入越来越多地被重用为其他系统的感知层。
现实世界的实施
图像注释平台使用 SAM 让标记器单击一次并自动生成精确的对象蒙版,从而缩短标记时间。
研究人员采用 SAM(例如 MedSAM)在 CT 和 MRI 扫描中勾勒出器官和肿瘤的轮廓。
照片和视频编辑器集成了 SAM,只需单击一下即可剪切主题或删除背景。
SAM 2 跨视频帧跟踪和分割对象,以实现 AR 效果和机器人感知。
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Segment Anything Model?
分段任意模型 (SAM) 是 Meta AI 用于图像分割的基础模型:给定点、框或粗略提示,它会立即勾勒出相应对象的轮廓。它的构建目的是泛化到训练期间从未见过的对象和图像,从而使分割成为一项快速的任务。
什么样的核心思想使 SAM 成为细分的“基础模型”?
SAM 将分割重新定义为可提示的,并设计用于零样本传输到其训练集之外的对象和图像。
用于训练 SAM 的 SA-1B 数据集大约有多大?
SA-1B 在大约 1100 万张图像上包含超过 10 亿个掩模,使用模型在环注释引擎构建。
为什么 SAM 将其架构分为重型图像编码器和轻量级提示编码器/解码器?
昂贵的图像编码运行一次;然后,廉价的提示编码和掩码解码允许对同一图像进行快速、交互式的重新提示。
SAM 如何处理不明确的提示,例如单击一次可能意味着多个对象?
SAM 输出几个带有分数的候选掩码,因此可以通过排名或附加提示来解决歧义。
SAM 使用什么类型的主干来编码输入图像?
SAM 的图像编码器是一个 Vision Transformer,通常使用屏蔽自动编码进行预训练,产生密集的图像嵌入。