大型语言模型的新兴能力
突现能力是指一旦达到一定规模就会在大型语言模型中突然出现的技能,即使较小的模型没有表现出这些迹象。
概述
They matter because they make capabilities hard to predict from small-scale experiments.
深入探讨
Wei 及其同事在 2022 年发表的一篇论文中流行起来,“涌现”是指较小模型的性能保持接近机会的任务,然后一旦模型跨越参数、数据或计算的大小阈值,性能就会急剧跳跃。报告的示例包括多步算术、某些推理基准以及遵循新颖的指令。引人注目的部分是不连续性:技能并没有逐渐提高,似乎不存在,然后又出现。 Schaeffer 及其同事在 2023 年的后续行动中认为,某些出现在一定程度上是一种测量伪影,因为严格的“全有或全无”指标(例如精确匹配)会夸大突然的跳跃,而在较软的评分下,这些跳跃看起来很平滑。这场辩论重塑了研究人员报告扩展结果和选择评估指标的方式。
技术洞察
涌现是否“真实”通常取决于衡量标准。通过精确匹配评分的任务在每一步都正确之前给出零积分,因此每个令牌准确性的稳定潜在收益可能表现为突然的飞跃。切换到连续指标,例如代币级可能性或部分信用,曲线通常看起来很平滑。因此,涌现反映了真正的能力增长与所选评分规则中内置的不连续性之间的相互作用。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
大型语言模型的新兴能力的未来
研究人员现在将扩展研究与多个指标结合起来,将真实的相位变化与伪影区分开来,并探究哪些功能真正达到了扩展的目的。更好的可预测性对于安全至关重要,因为不可预见的能力可能包括危险的能力。预计在提前预测能力的缩放法则方面会有更多工作,加上仔细的基准设计,以便所谓的“出现”反映模型行为而不是测量的怪癖。
现实世界的实施
大型模型解决多步骤的文字问题,而较小的模型则在机会级别上回答。
模型在跨越规模阈值后突然遵循复杂的、前所未见的指令。
只有当模型达到足够的尺寸时,思维链才会促进推理。
研究人员通过部分信用评分重新规划“突然”的基准跳跃并找到一条平滑的曲线。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Emergent Abilities of Large Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Emergent Abilities of Large Language Models?
突现能力是指一旦达到一定规模就会在大型语言模型中突然出现的技能,即使较小的模型没有表现出这些迹象。它们很重要,因为它们使能力难以通过小规模实验来预测。
什么定义了大型语言模型中的涌现能力?
在较小的模型中,涌现能力几乎不存在,但一旦规模超过阈值,涌现能力就会急剧出现。
Schaeffer 及其同事在 2023 年的后续行动中提出了什么观点?
他们表明,全有或全无的指标可以使平稳的基本收益看起来像是突然跳跃。
为什么精确匹配评分会夸大出现率?
精确匹配不会对部分进展给予功劳,因此每个令牌的稳定改进看起来像是突然的飞跃。
哪些尺度因素与涌现相关?
随着模型参数、训练数据和计算的增长,会出现紧急跳跃。
为什么涌现对于人工智能安全很重要?
如果能力突然大规模出现,一些意想不到的能力可能会产生危险,从而激发更好的预测。