情境学习
上下文学习是大型语言模型令人惊讶的能力,可以从提示中的几个示例中获取新任务,而无需任何重新训练。
概述
It is the reason you can 'teach' a model on the fly just by showing it what you want.
深入探讨
通常,向神经网络教授新任务意味着通过训练更新其权重。上下文学习是不同的:您直接在提示(“上下文”)中编写一些示例,模型推断模式并将其应用到新的输入。模型内部没有任何变化;这些例子只是引导下一个标记的预测。您将听到“零次”(仅说明)、“一次”(一个示例)和“几次”(几个示例)。这种行为在 2020 年由 GPT-3 推广,并被证明是一种新兴能力:微小的模型无法做到这一点,但超过大约 1000 亿个参数的规模,几次提示的准确性急剧上升。该模型在预训练期间有效地学会了识别和继续模式,因此它可以在推理时重用该技能。
技术洞察
可解释性研究将这种能力很大程度上追溯到“归纳头”——训练过程中出现的注意回路,并执行模糊前缀匹配:它们回扫相似标记出现的位置,然后复制其后面的内容。因此,当您的提示显示“苹果 -> 水果、胡萝卜 -> 蔬菜”时,模型会匹配结构并预测下一个项目的正确标签。至关重要的是,推理时没有梯度流动,也没有权重更新。这些示例只是重塑了提供下一个标记概率分布的激活。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
情境学习的未来
扩大上下文窗口(现在有数十万个标记)将上下文学习推向“多次”模式,其中数十或数百个示例可以与某些任务的微调相媲美,而无需培训成本。期望与检索更紧密地集成,以便自动获取相关示例,并在上下文学习失败或分散注意力时提供更好的理论。它将仍然是适应模型的快速、廉价的方式,补充(而不是取代)对稳定、大批量任务的微调。
现实世界的实施
为聊天机器人提供三个示例支持票证及其类别,然后让它以相同的方式对新票证进行分类
显示一个模型,前后两对混乱的文本被重新格式化为干净的 JSON,以便它转换其余的文本
以您的品牌基调粘贴一些示例产品描述,以便新产品与风格相匹配
逐步演示棘手的数学单词问题,以便模型使用相同的推理格式解决类似的问题
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the In-Context Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is In-Context Learning?
上下文学习是大型语言模型令人惊讶的能力,可以从提示中的几个示例中获取新任务,而无需任何重新训练。这就是为什么你可以通过向模型展示你想要的内容来即时“教授”模型。
在情境学习过程中模型内部发生了什么根本变化?
情境学习完全发生在推理中。提示中的示例塑造了模型的激活和下一个标记预测,但没有更新权重。
为什么情境学习被描述为一种“涌现”能力?
这种能力在小型模型中很弱或不存在,而一旦模型达到非常大的规模,这种能力就会急剧上升,这就是为什么它被称为紧急的。
哪种内部机制与 Transformer 中的上下文学习最相关?
可解释性工作将归纳头(即发现相似标记出现的位置并复制接下来出现的内容的注意回路)确定为情境学习的核心驱动力。