视觉人工智能指南

全景分割

全景分割为图像中的每个像素提供一个标签,将“这个区域是什么”与“这是哪个特定对象”统一起来。它是计算机视觉中最完整的场景理解形式。

阅读时间:2分钟最后更新

深入探讨

计算机视觉长期以来有两个独立的任务。语义分割按类别(道路、天空、人)标记每个像素,但无法区分两个人。实例分割查找并勾勒出单个可数对象,但忽略天空或草地等背景“东西”。 Facebook 人工智能研究人员于 2018 年正式提出的全景分割将两者融合在一起:它为每个像素分配一个类别,并且对于可数的“事物”,它还分配一个唯一的实例 ID。结果是一个没有间隙或重叠的连贯地图。质量通过全景质量 (PQ) 来衡量,它将区域识别的准确度与其边界的匹配程度结合起来。当机器必须完全理解整个场景时,例如自动驾驶汽车解释街道,这一点至关重要。

技术洞察

全景模型将标签分为“事物”(可数对象,如汽车和人,可以获得实例 ID)和“东西”(无定形区域,如道路或天空,但没有)。早期的系统运行单独的语义和实例分支,然后将它们与规则融合以解决像素冲突。较新的基于转换器的方法(例如 Mask2Former)直接预测一组具有关联类标签的掩码,在一个统一的架构中处理事物和东西。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

全景分割的未来

该领域正在围绕统一的、基于查询的转换器架构进行整合,这些架构可以使用一个模型处理语义、实例和全景任务。研究正在推动视频全景分割,使实例身份在帧之间保持一致,开放词汇模型分割文本中描述的类别,以及对机器人和车辆足够高效的更轻模型。更好的合成训练数据和自我监督正在降低像素完美手动注释的沉重成本。

现实世界的实施

自动驾驶车辆构建完整的像素级地图,区分每辆汽车、行人、道路和人行道

医学成像可标记器官区域,同时对单个病变或细胞进行计数

增强现实应用程序可将每个对象和表面分开,以真实地放置虚拟内容

完全解析杂乱场景以规划抓取和导航的机器人系统

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Panoptic Segmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

什么是全景分割?

全景分割为图像中的每个像素提供一个标签,将“这个区域是什么”与“这是哪个特定对象”统一起来。它是计算机视觉中最完整的场景理解形式。

全景分割为图像中的每个像素分配什么?

全景分割用类别标记每个像素,并另外为可数的“事物”提供唯一的实例 ID,不留间隙或重叠。

用全景术语来说,什么是“东西”类?

“东西”是指不可数的、无定形的背景区域,例如天空或道路,它们接收类别但没有实例 ID。

全景分割克服的语义分割的主要局限性是什么?

语义分割按类别标记像素,但无法将两个人分开;全景添加实例标识。

使用哪个指标来评估全景分割质量?

全景质量 (PQ) 将识别准确度与分割重叠相结合,对事物的预测效果进行评分。

“东西”类收到了“东西”类没有收到的哪些信息?

可数的“事物”获得唯一的实例 ID,因此可以区分各个对象,而“事物”仅获得一个类别。