视觉人工智能指南

恐龙自蒸馏

DINO 是一种自我监督方法,通过网络自学来训练视觉转换器理解完全没有标签的图像。

阅读时间:2分钟最后更新

概述

It produces features so clean that object boundaries emerge for free in the attention maps.

深入探讨

DINO 是 self-distillation with no labels 的缩写,由 Meta AI(当时的 Facebook AI)于 2021 年发布。它使用同一网络的两个副本——一个学生和一个老师——并向他们提供一张图像的不同增强作物。学生试图匹配老师的输出分布,即使老师只看到不同的视图。至关重要的是,老师没有直接接受过培训,而是直接接受过培训。它的权重是学生的指数移动平均值,慢慢落后。为了防止网络崩溃为单一恒定答案,DINO 集中并锐化了教师的输出。一个惊人的结果是,所得到的视觉变换器的自注意力图会分割对象,而无需知道对象是什么。

技术洞察

两个网络在 softmax 之后都输出高维概率分布。学生看到的是当地的小作物加上全球视野,而老师只看到全球视野——这是一种推动本地到全球一致性的多作物策略。损失是教师和学生分布之间的交叉熵,梯度仅流经学生。有两个技巧可以防止崩溃:中心化从教师逻辑中减去运行平均值,低温使它们锐化,相互平衡,使输出保持多样化。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

DINO 自蒸馏的未来

DINO 启动了一项主要工作。 DINOv2(2023)将配方扩展到超过十亿个精选图像,产生了在深度估计、分割和检索方面可与监督模型相媲美的通用视觉特征——无需微调即可使用。随着该领域追逐视觉、机器人和多模态系统的无标签基础模型(这些领域的注释成本很高),预计自蒸馏仍将保持核心地位。新兴的分割特性也不断推动对可解释的、开放词汇感知的研究。

现实世界的实施

无监督的对象分割,其中 DINO 的注意力映射轮廓对象,没有任何掩模标签

图像检索和复制检测,使用 DINO 特征查找近似重复或视觉上相似的图像

DINOv2 作为深度估计和密集预测任务的冻结骨干网

在标记数据稀缺或昂贵的情况下预训练医疗或卫星视觉模型

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DINO Self-Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

DreamFusion 和分数蒸馏采样

常见问题

What is DINO Self-Distillation?

DINO 是一种自我监督方法,通过网络自学来训练视觉转换器理解完全没有标签的图像。它产生的特征非常清晰,以至于对象边界在注意力图中自由出现。

DINO 中的“NO”代表什么?

DINO 的意思是没有标签的自蒸馏——它是完全自我监督的,不需要人工注释。

DINO 中教师网络的权重如何更新?

老师是学生的EMA,所以它会平稳地跟踪学生,而不是直接接受培训。

教师输出的集中和锐化可以防止什么问题?

集中和锐化相互平衡,以保持教师输出的多样性,避免琐碎的恒定解决方案。

在 DINO 的多种作物策略中,老师收到了哪些意见?

老师只看到全球作物,而学生也看到小型当地作物,鼓励本地到全球的一致性。

经过 DINO 训练的视觉变换器的注意力图中出现了什么令人惊讶的特性?

DINO 的自注意力自然地突出了对象边界,尽管从未看到掩模,但仍然执行分割。