YaRN 上下文窗口缩放
YaRN(另一种 RoPE 扩展)是一种将 Transformer 的可用上下文窗口延伸到远远超出其训练范围的技术,只需进行最少的微调。
概述
这很重要,因为它可以让现有模型处理更长的文档,而无需从头开始重新训练。
深入探讨
大多数现代法学硕士都使用旋转位置嵌入 (RoPE) 来编码单词位置,这种方法只能在模型训练期间看到的长度内有效。输入较长的序列,模型会严重退化。 YaRN 通过以频率感知的方式重新调整 RoPE 的旋转频率来解决这个问题:高频维度(捕获本地、附近的关系)大部分保持不变,而低频维度(捕获远程位置)则进行插值。它还增加了注意力的温度调节,以保持逻辑在远距离表现良好。结果在 LLaMA 模型上得到了证明,仅使用约 0.1% 的原始训练数据和数百个微调步骤,即可将上下文从 4K 扩展到 64K-128K 令牌。
技术洞察
RoPE 将查询向量和键向量旋转与位置和每维度频率成比例的角度。朴素的线性插值(位置插值)会同等地压缩所有频率,从而损害局部细节。 YaRN 相反应用“NTK-by-parts”:它仅对低频(长波长)维度进行插值,单独保留高频维度,并在它们之间进行斜坡。注意力温度的缩放可以补偿熵位移,从而在扩展长度下保持准确性。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
YaRN 上下文窗口缩放的未来
YaRN 风格的频率感知扩展已成为发布长上下文模型的默认成分;随着实验室向百万代币窗口推进,变体和后继者不断出现。期望与高效关注、KV 缓存压缩和根据请求动态调整的动态扩展进行更紧密的集成。更广泛的趋势是将“模型训练多长时间”与“模型可以有效读取多长时间”脱钩,使长上下文成为廉价的训练后功能,而不是昂贵的架构承诺。
现实世界的实施
将开放的 LLaMA 模型从 4K 扩展到 128K 代币,以便它可以一次性摄取整个代码库或长合约
让聊天机器人保留很长的对话历史记录,而不会截断之前的对话
总结超出基本模型本机窗口的书本长度文档或多小时转录本
仅使用少量微调运行即可廉价地调整预训练模型以执行长上下文检索任务
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是 YaRN 上下文窗口缩放?
YaRN(另一种 RoPE 扩展)是一种将 Transformer 的可用上下文窗口延伸到远远超出其训练范围的技术,只需进行最少的微调。这很重要,因为它可以让现有模型处理更长的文档,而无需从头开始重新训练。
YaRN 修改了什么位置编码方案来扩展上下文长度?
YaRN 代表“又一个 RoPE 扩展”,通过重新调整旋转位置嵌入中使用的旋转频率来工作。
YaRN 如何处理高频与低频 RoPE 维度?
YaRN 的“NTK-by-parts”方法保留高频(局部)维度,同时插入低频(远程)维度以避免损害局部细节。
与从头开始训练长上下文模型相比,YaRN 的关键效率优势是什么?
YaRN 可以使用大约 0.1% 的原始训练数据和少量的微调步骤来扩展上下文,比重新训练便宜得多。
除了重新调整频率之外,YaRN 还应用哪些额外调整来保持远程注意力稳定?
YaRN 修改注意力温度以补偿当序列变得更长时发生的熵/logit 偏移。
如果您输入的 RoPE 模型序列远长于训练时的序列,且没有任何缩放,会出现什么问题?
RoPE 对于看不见的多头头寸的泛化能力很差,因此除非重新调整频率,否则质量会崩溃。