技术指南

BYOL 和非对比性自我监督

BYOL(Bootstrap Your Own Latent)可以在没有任何标签的情况下学习有用的图像表示,而且令人惊讶的是,没有负面例子。

阅读时间:2分钟最后更新

概述

It showed that self-supervised learning need not rely on pushing apart dissimilar images, sidestepping the need for huge batches of negatives.

深入探讨

大多数早期的自我监督方法都是对比的:它们将同一图像的两个增强视图拉在一起,同时将不同的图像分开,这需要许多负样本以避免崩溃(网络为所有内容输出相同的向量)。 DeepMind 在 2020 年推出的 BYOL 完全消除了负面影响。它使用两个网络:在线网络和目标网络。一张图像的两个增强视图通过两个网络;在线网络添加了一个预测头,并经过训练来预测目标网络对另一个视图的表示。至关重要的是,目标网络的权重不是通过梯度下降来训练的。相反,它们是在线权重的指数移动平均值 (EMA)。这种不对称性加上 EMA 目标可以防止对比方法担心的微不足道的崩溃,匹配或击败 ImageNet 上的对比基线。

技术洞察

三种成分可以在没有负数的情况下停止崩溃:在线分支上的额外预测器 MLP、目标分支上的停止梯度以及 EMA 更新的目标。该目标充当缓慢移动的回归目标,因此在线网络追逐稳定的、滞后的目标,而不是其自身的移动副本。预测器的不对称性打破了对称性,否则会让两个分支平凡地输出一个常数。投影仪中的批量归一化也有助于隐式正则化。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

BYOL 和非对比自我监督的未来

现在,非对比性的想法在很大程度上是自我监督的愿景的基础。 SimSiam 进一步剥离了 BYOL,表明如果保留停止梯度,则并不严格要求 EMA 目标,从而加深了对为何避免崩溃的理解。预计这些无标签预训练方法将继续与蒙版图像建模和多模态训练相结合,并扩展到标签稀缺或昂贵的视频、音频、医学成像和机器人领域,通常作为轻量级监督微调之前的预训练阶段。

现实世界的实施

在数百万张未标记的照片上预训练视觉主干,然后在缺乏专家注释的小型标记医学成像数据集上进行微调。

从原始相机流中学习机器人感知功能,无需手动标记,从而降低了教学操作任务的成本。

使用 BYOL 嵌入构建图像检索和重复数据删除系统,将视觉上相似的图像分组,而无需任何类标签。

在对土地利用或森林砍伐分类进行微调之前,在大量未标记的档案上初始化卫星或航空图像模型。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BYOL and Non-Contrastive Self-Supervision quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

伪标签和自我训练

常见问题

What is BYOL and Non-Contrastive Self-Supervision?

BYOL(Bootstrap Your Own Latent)可以在没有任何标签的情况下学习有用的图像表示,而且令人惊讶的是,没有负面例子。它表明,自我监督学习不需要依赖于推开不同的图像,从而避免了对大量底片的需要。

是什么让 BYOL 在当时的自我监督方法中脱颖而出?

BYOL 表明,在没有负对的情况下,强表示学习是可能的,这打破了对比方法。

BYOL 中目标网络的权重如何更新?

目标网络是在线网络的 EMA(慢速移动副本),并且没有通过梯度下降进行训练。

人们担心消除底片时会发生什么问题?为什么这很重要?

如果没有底片,简单的设置可能会崩溃为恒定的输出; BYOL 的设计可以防止这种情况发生。

哪个组件仅添加到在线分支以打破对称性?

在线分支有一个额外的预测器头;它产生的不对称性是避免崩溃的关键。

在线网络实际上被训练用来做什么?

BYOL 最大限度地减少了在线预测与目标的其他视图表示之间的差异。