视觉变形金刚
视觉变换器 (ViTs) 将支持 ChatGPT 的变换器架构应用于图像,将图片视为补丁序列而不是像素网格。
概述
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
深入探讨
多年来,卷积神经网络(CNN)通过扫描图像上的小过滤器主导了计算机视觉。 Google 的 2020 年论文“一张图像值得 16x16 个字”对此提出了挑战,方法是将图像切成固定的块(通常为 16x16 像素),将每个块展平为向量,并将生成的序列输入标准转换器。每个补丁都成为一个“令牌”,就像句子中的单词一样。然后,该模型使用自注意力,因此每个补丁都可以直接与其他每个补丁相关,捕获小型卷积滤波器一步无法看到的远程关系。问题是:ViT 需要大量数据,因为它们缺乏 CNN 的内置假设。在 JFT-300M 等庞大数据集上进行训练后,它们匹配或击败了最好的 CNN,重塑了现代视觉研究。
技术洞察
ViT 将图像分割为不重叠的补丁,将每个补丁线性投影到嵌入中,并添加位置编码,以便模型知道每个补丁位于原始图像中的位置。前面有一个特殊的可学习的“类标记”;它的最终表示驱动分类。堆叠的自注意力层让每个补丁权衡来自所有其他补丁的信息,从第一层给出全局感受野。由于注意力随块的数量呈二次方缩放,因此高分辨率图像变得昂贵,这就是块大小和有效的注意力变体很重要的原因。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
视觉变形金刚的未来
ViT 和 CNN 变压器混合体现在为领先的视觉系统提供动力,该架构支持将图像与文本融合的多模态模型,例如 CLIP 和现代视觉语言助手。预计将继续致力于降低高分辨率和视频的注意力,以及减少对标记数据的巨大需求的自我监督预训练(例如掩模图像建模)。随着计算的增长,“语言模型”和“视觉模型”之间的界限不断模糊,变压器充当跨模式的共享骨干,而不是单独的专门设计。
现实世界的实施
ViT 证明与 CNN 具有竞争力后,Google 的图像分类和搜索排名系统采用了 Transformer 主干
CLIP 和其他使用 ViT 对图像进行编码的图像文本模型,以便可以在共享空间中匹配照片和标题
医学成像研究使用 ViT 来发现整个扫描中的模式,而不仅仅是局部纹理
自动驾驶和机器人感知堆栈结合了 ViT 式注意力,可在整个视野范围内进行场景理解
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Vision Transformers?
视觉变换器 (ViTs) 将支持 ChatGPT 的变换器架构应用于图像,将图片视为补丁序列而不是像素网格。他们证明,不需要卷积即可实现最先进的图像识别。
Vision Transformer 最初如何处理输入图像?
ViT 将图像划分为固定的补丁(通常为 16x16 像素),将每个补丁嵌入为令牌,并将序列输入转换器。
什么关键机制可以让 ViT 将图像的远距离部分相互关联?
自注意力让每个补丁直接权衡其他补丁的信息,从第一层提供全局视图。
为什么普通视觉变形金刚通常需要非常大的训练数据集才能表现出色?
与 CNN 不同,ViT 不假设局部性或平移不变性,因此它们必须从大量数据中学习这些模式。
Vision Transformer 中位置编码的目的是什么?
自注意力与顺序无关,因此位置编码可以恢复每个补丁的空间位置。
哪种说法最能体现 ViT 对计算机视觉的影响?
ViT 证明,具有足够数据和规模的纯 Transformer 可以与最好的卷积网络相媲美或超越。