语言人工智能指南

用于上下文扩展的位置插值

位置插值 (PI) 是一种通过重新缩放位置索引而不是外推位置索引来将语言模型的可用上下文窗口延伸到远远超出其训练长度的技术。

阅读时间:2分钟最后更新

概述

It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.

深入探讨

大多数现代法学硕士都使用旋转位置嵌入(RoPE),它将位置编码为应用于查询和键向量的旋​​转角度。如果你只是输入更长的序列,模型会看到它从未训练过的位置和旋转角度,并且性能会崩溃,因为注意力很难推断出范围之外的频率。位置插值避免了外推:为了从长度 L 延伸到长度 L',它将每个位置索引除以因子 L'/L,将新范围压缩回训练区间。该模型现在只能看到分布角度,只是间隔更密集。短暂的微调(通常是几百到一千步)可以让它适应更精细的间距,以预训练成本的一小部分产生稳定的长上下文行为。

技术洞察

RoPE 以从细到粗的频率旋转尺寸对。 PI 将位置 m 重新调整为 m/s,其中 s = L'/L,因此旋转角度保持在训练范围内而不是外推。 NTK 感知缩放和 YaRN 等频率感知变体更进一步:它们更少地缩放低频,更多地缩放高频(或按波长插值),保留高频局部细节,同时扩展低频长距离范围。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

上下文扩展位置插值的未来

上下文扩展正在快速发展。 NTK 感知的 RoPE 缩放、YaRN 和动态/长 RoPE 等方法现在将窗口推向数十万甚至数百万个令牌,有时几乎不需要微调。预计这些扩展技巧将与高效的注意力和 KV 缓存压缩相结合,并成为模型配置中的标准旋钮。研究仍在继续,以便在整个窗口中保持较高的准确性,以便上下文真正可用,而不仅仅是名义上支持。

现实世界的实施

将 4K 训练的 LLaMA 模型扩展到 32K 上下文,以在短暂微调后总结长文档。

将整个代码库或大型法律合同加载到一个提示中以进行跨文件问答。

使用 NTK 感知或 YaRN 缩放来延长上下文,只需最少或无需额外培训。

通过在推理时重新调整 RoPE 位置,提供长聊天历史记录而不会被截断。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Position Interpolation for Context Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

YaRN 和上下文长度扩展

常见问题

What is Position Interpolation for Context Extension?

位置插值 (PI) 是一种通过重新缩放位置索引而不是外推位置索引来将语言模型的可用上下文窗口延伸到远远超出其训练长度的技术。它让在 2K 或 4K 令牌上训练的模型只需进行轻微微调即可处理 32K 或更多。

位置插值的核心思想是什么?

PI 将位置索引除以扩展因子,将较长的序列映射回模型已学习的分布范围内。

位置插值与哪种位置编码方案最相关?

PI 在基于 RoPE 的模型中得到普及,可以重新调整旋转角度,使其保持在训练频率内。

为什么对更长上下文的天真推断往往会失败?

输入较长的序列会使模型暴露在从未训练过的范围之外的角度,导致注意力和性能急剧下降。

如果将上下文长度从 L 扩展到 L',基本 PI 将什么重新缩放因子应用于位置 m?

PI 将 m 映射到 m 除以因子 s = L'/L,将较长范围压缩到原始训练区间。

NTK 感知缩放和 YaRN 如何改进普通位置插值?

这些方法以不同的方式缩放低频和高频,保留细粒度的局部位置细节,同时仍然达到更长的上下文。