基础知识指南

自我监督学习

自监督学习通过发明一个任务来训练未标记数据的模型,该任务的答案隐藏在数据本身中。

阅读时间:2分钟最后更新

概述

It is how modern language and vision foundation models learn from the raw internet without armies of human labelers.

深入探讨

手动标记数据既缓慢又昂贵,但世界上充满了未标记的文本、图像、音频和视频。自我监督学习通过创建“借口任务”来解锁它,其中数据提供自己的答案。典型的例子是 BERT 使用的屏蔽语言模型:隐藏句子中的一些单词并训练模型根据上下文来预测它们。 GPT 风格的模型预测下一个单词。在视觉方面,SimCLR 等对比方法向模型展示同一图像的两个增强作物,并教会它它们属于在一起,同时将不同的图像分开。解决这些自制的难题迫使模型构建丰富的意义和结构的内部表示。然后,这些表示可以在很少或没有标记数据的情况下有效地转移到真正的下游任务。

技术洞察

诀窍是免费生成监督信号。在屏蔽建模中,隐藏的标记是标签,因此可以在没有任何人工注释的情况下计算损失。在对比学习中,一个图像的两个增强形成一个“正对”,应该靠近嵌入空间,而其他图像则被“负”推开。无论哪种方式,模型都会在纯粹从数据自身结构派生的标签上进行优化,学习随后只需要进行轻微微调的一般特征。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

自我监督学习的未来

自我监督学习是当今基础模型背后的引擎,而且这一作用只会越来越大。明显的趋势是多模式预训练,其中单个模型使用自我监督目标从文本、图像、音频和视频中联合学习。研究人员正在超越对比方法,转向视觉中的掩模预测方法和不需要反面例子的自蒸馏技术。随着高质量标记数据成为瓶颈,直接从大量未标记数据流中学习有用的结构将仍然是扩展人工智能的核心策略。

现实世界的实施

BERT 通过预测屏蔽单词来学习语言,然后针对搜索、情绪或问题回答进行微调

SimCLR 在未标记的照片上预训练图像编码器,以便稍后可以使用很少的标签进行分类

GPT 风格的模型通过在巨大的文本语料库中重复预测下一个标记来学习写作

在适应转录之前,对原始未标记音频进行预训练的语音模型(预测掩蔽声音片段)

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录自我监督学习在哪些方面有帮助以及哪些更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Supervised Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Self-Supervised Learning?

自监督学习通过发明一个任务来训练未标记数据的模型,该任务的答案隐藏在数据本身中。这就是现代语言和视觉基础模型如何从原始互联网中学习,而无需大量人工标记者。

是什么让学习成为“自我监督”?

自监督学习发明了一种借口任务,其中答案隐藏在数据中,因此不需要人工标记。

为什么自监督学习对于基础模型如此有价值?

由于监督信号来自数据本身,因此可以在网络上大量未标记的语料库上对模型进行预训练。

自监督预训练之后,接下来通常会发生什么?

预训练构建了传输良好的通用表示,因此特定任务只需要对标记数据进行轻微微调。

GPT 式模型的自监督任务与 BERT 有何不同?

GPT 风格的模型经过训练来预测序列中的下一个标记,而 BERT 使用左右上下文来预测屏蔽标记。