基础知识指南

少样本学习

少样本学习是指从少数而不是数千个示例中学习新任务的能力。

阅读时间:2分钟最后更新

概述

这很重要,因为它反映了人类的概括方式,并让现代人工智能能够立即适应,而无需昂贵的再培训。

深入探讨

传统的机器学习需要巨大的标记数据集,但少样本学习的目标是在每个类仅看到几个示例后表现良好。大型语言模型普及了上下文中的小样本学习:您直接在提示中放置一些输入输出示例,模型会推断出模式并将其应用于新的输入,所有这些都无需更新其权重。该术语来自对显示的示例进行计数,通常写为 N-way K-shot(N 个类,每个类有 K 个示例)。零样本意味着没有例子,一样本意味着一个,而少样本通常意味着两个到几十个。这是有效的,因为模型在预训练期间已经吸收了广泛的模式,因此一些示例主要提示要使用哪些现有技能。

技术洞察

上下文中的小样本学习依赖于 Transformer 阅读提示中的示例并使用注意力来匹配模式,没有梯度更新或权重变化。这些示例限制了模型对新输入的下一个标记预测。一个单独的系列、基于度量的方法(例如原型网络和匹配网络)会学习嵌入空间,在其中将新样本与每个类的几个示例的平均值进行比较并选择最接近的。两条路线都利用了先前的学习,因此稀缺标签大有帮助。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

少样本学习的未来

小样本学习正在成为人们使用大型模型的默认方式,因此前沿技术正在使其变得更加可靠:更好的示例选择、排序和检索,因此提示会自动选择最有用的演示。期望与检索更紧密地集成,以及适合更多示例的更长上下文窗口,以及对示例顺序和格式摆动准确性为何如此之高的研究。随着模型的改进,零样本和少样本之间的差距缩小了,以完成简单的任务,而少样本对于特殊格式和边缘情况仍然很有价值。

现实世界的实施

在提示中显示模型后,将客户支持票证分类为每个类别的三个或四个带标签的示例。

通过提供两个或三个示例输入输出对来教聊天机器人特定的输出格式(例如带有命名字段的 JSON)。

使用视觉系统中的原型网络从少数拍摄的样品中识别罕见的制造缺陷。

通过在请求中包含几个前后示例,调整翻译或摘要风格以匹配品牌的声音。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录少样本学习在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Few-Shot Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

什么是小样本学习?

少样本学习是指从少数而不是数千个示例中学习新任务的能力。这很重要,因为它反映了人类的概括方式,并让现代人工智能能够立即适应,而无需昂贵的再培训。

在“N-way K-shot”符号中,K 指的是什么?

K 是为每个类别给出的示例数量,而 N 是类别数量(“方式”)。

当大型语言模型根据提示进行上下文中的几次学习时,其权重会发生什么?

上下文学习不执行梯度更新;提示中的示例只是指导模型的下一个标记预测。

零次提示和少次提示之间的主要区别是什么?

零样本仅提供说明,没有示例,而少样本则包含少量演示。

为什么几个例子就足以让大型预训练模型很好地执行新任务?

预训练中的广泛知识意味着一些演示主要表明可以使用哪些现有能力,而不是从头开始教学。

其中描述了像原型网络这样基于度量的小样本方法?

原型网络为每个类形成一个原型(平均嵌入),并通过学习空间中最近的原型对新点进行分类。