视觉人工智能指南

开放词汇目标检测

开放词汇对象检测允许模型查找并框出由任意文本描述的对象,包括在训练期间从未见过的标记类别。

阅读时间:2分钟最后更新

概述

It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.

深入探讨

经典检测器在一组封闭的类别上进行训练,例如 COCO 中的 80 个类别,并且无法识别该列表之外的“事物”。开放词汇检测通过将视觉区域特征与共享视觉语言嵌入空间对齐来打破这一限制,通常从大量图像文本对中学习(如 CLIP)。在推理时,您提供文本标签,模型嵌入这些标签,并将检测到的区域与最接近的文本嵌入相匹配,因此只要您可以描述新的类别,它们就可以工作。 ViLD、GLIP、OWL-ViT、Detic 和 Grounding DINO 等系统通过将检测主干与语言基础相结合以及通过对大型、弱标记或基础数据集进行训练来普及该方法。

技术洞察

诀窍是用文本嵌入替换固定的分类器层。检测器不是为每个已知类别学习一个权重向量,而是将每个区域投影到与语言编码器相同的空间中;分类变成区域特征与用户提供的类别名称或短语的嵌入之间的相似性比较。由于文本编码器可以泛化到未见过的单词,因此在测试时交换新的标签字符串可以检测边界框训练数据中缺少的类别。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

开放词汇目标检测的未来

开放词汇检测正在与基础和分割相融合,其中自由格式短语(不仅仅是单个单词)定位对象,并与提示系统结合模型(例如用于掩模的 SAM)。期望更强的零射击精度、更长、更具组合性的文本查询(“笔记本电脑后面的红色杯子”),以及与按需检测的多模式助手的紧密耦合。随着网络规模的图像文本训练的改进,检测、检索和语言理解之间的界限将朝着一般视觉基础不断模糊。

现实世界的实施

通过输入名称来搜索图像中的稀有或自定义对象,无需重新训练

机器人系统在抓取用户用自然语言命名的物品之前对其进行定位

通过从文本列表中检测许多新类别来自动标记数据集

内容审核,标记原始训练标签中不存在的描述对象

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Vocabulary Object Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Open-Vocabulary Object Detection?

开放词汇对象检测允许模型查找并框出由任意文本描述的对象,包括在训练期间从未见过的标记类别。这很重要,因为传统的检测器被锁定到固定的类列表,而开放词汇模型可以检测几乎任何你能命名的东西。

开放词汇目标检测的定义能力是什么?

开放词汇检测可以在测试时本地化由文本指定的类别,甚至是从未见过的用边界框标记的类别。

这些模型如何对检测到的区域进行分类?

他们将区域投影到视觉语言嵌入空间中,并将每个区域与最接近的文本标签嵌入相匹配。

哪种预训练资源最能实现开放词汇检测?

大量图像文本数据(由 CLIP 样式模型使用)构建了共享嵌入空间,使文本能够泛化到新类别。

与闭式检测器相比,更换了哪个部件?

分类不是使用固定的类别权重向量,而是使用与文本嵌入的相似性,因此可以在测试时添加新的标签字符串。

以下哪一个是开放词汇或基础检测模型的示例?

接地 DINO 以及 GLIP、OWL-ViT、ViLD 和 Detic 都是众所周知的开放词汇或接地探测器。