视觉人工智能指南

CLIP 和视觉语言模型

CLIP 是来自 OpenAI 的模型,它通过将图像和文本放置在同一数学空间中来学习连接图像和文本。

阅读时间:2分钟最后更新

概述

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

深入探讨

CLIP(对比语言-图像预训练)于 2021 年发布,使用从网络上抓取的约 4 亿个图像-标题对进行训练。它使用两个编码器:一个将图像转换为向量,另一个将文本转换为向量,并且两者都位于共享的嵌入空间中。该模型进行学习,以便将狗的照片和“狗的照片”一词放在一起,而不匹配的配对则放在很远的位置。这解锁了零样本分类:要标记图像,您可以将其与候选类别的文本描述进行比较并选择最接近的,而无需训练专用的分类器。 CLIP 成为基础设施,指导图像生成器,支持语义图像搜索,过滤数据集,并为当今更大的视觉语言模型(如 Flamingo、LLaVA 和 GPT-4V)提供种子。

技术洞察

CLIP 是按照对比目标进行训练的。在一批图像-文本对中,它计算每个图像和每个标题之间的相似度(通过余弦相似度),然后调整编码器以最大化正确对的分数并最小化所有错误组合的分数。图像编码器通常是一个 Vision Transformer,它将图片分割成多个块;文本编码器是令牌上的转换器。由于两者都会产生可比较的矢量,因此您可以将任何图像与任何文本即时匹配。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

CLIP 和视觉语言模型的未来

CLIP 式对齐现在是大型多模态模型中的构建块,这些模型还可以聊天、推理和回答有关图像的问题。期待更大、更干净的训练集、对多种语言的支持以及对视频和音频的扩展。研究人员正在努力减少 CLIP 从网络数据中吸收的社会和人口统计学偏见,并提高对比模型仍然薄弱的细粒度理解(计算对象、阅读文本、空间关系)。随着 OpenCLIP 等开放版本的成熟,这种图像文本粘合将继续在搜索、机器人和辅助工具中传播。

现实世界的实施

使用“山上日落”等自然短语而不是文件名标签搜索照片库

指导文本到图像生成器,使输出与请求的提示匹配

通过将不安全或不符合政策的图像与禁止内容的文本描述进行比较来标记它们

自动组织大型未标记图像数据集或为其添加字幕,以用于研究或电子商务

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

机器人视觉-语言-动作模型

常见问题

What is CLIP and Vision-Language Models?

CLIP 是来自 OpenAI 的模型,它通过将图像和文本放置在同一数学空间中来学习连接图像和文本。它是图像搜索、内容审核和许多文本到图像生成器背后的安静主力。

CLIP背后的核心思想是什么?

CLIP 将图像和文本映射到一个共享向量空间中,以便可以直接测量它们的相似性。

CLIP 使用什么培训方法?

CLIP 使用对比目标:正确的图像标题对被拉近,而不匹配的图像标题对被推开。

CLIP 中的“零样本分类”是什么意思?

CLIP 可以通过将图像与候选类别的文本描述进行比较来标记从未经过专门训练来分类的图像。

CLIP 如何衡量图像和标题是否匹配?

CLIP将每个编码成向量并计算余弦相似度;相似度越高意味着语义匹配越接近。

CLIP 大约使用了多少数据进行训练?

CLIP 从互联网上收集的大约 4 亿个图像标题对中学习,为其提供了广泛的视觉语言知识。