旋转位置嵌入
旋转位置嵌入 (RoPE) 通过将查询向量和键向量旋转与位置成比例的角度,对每个标记在序列中的位置进行编码。
概述
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
深入探讨
变形金刚没有内置的顺序感,因此它们需要以某种方式添加位置信息。早期模型在输入中添加了固定的正弦向量或学习的位置嵌入。 Su 及其同事于 2021 年提出的 RoPE 采用了不同的方法:它不是添加位置向量,而是将查询和密钥向量中的维度对旋转一个角度,该角度随着令牌的位置而增长。当模型计算位置 m 处的查询和位置 n 处的键之间的点积时,数学会计算出来,因此结果仅取决于它们的相对距离 m 减去 n。这提供了真正的相对位置意识,与高效的注意力内核很好地配合,并随着距离平滑地衰减注意力。 RoPE 现在用于 Llama、Mistral、Qwen 和大多数现代开放式型号。
技术洞察
RoPE 成对处理嵌入尺寸,并对每对应用 2D 旋转,不同的对以不同的频率旋转,就像许多时钟的指针以不同的速度滴答作响。因为旋转位置 m,然后与旋转位置 n 的物体进行点积,仅留下角度差,因此注意力分数成为相对位置的函数。高频对捕捉精细的局部秩序;低频对捕获远程位置。至关重要的是,它修改查询和键,而不是值。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
旋转位置嵌入的未来
最近的许多工作都集中在将 RoPE 扩展到比模型训练时间更长的环境中。位置插值、NTK 感知缩放和 YaRN 等技术可调整旋转频率,因此在 4K 令牌上训练的模型可以通过轻微微调处理 32K 或更多。预计 RoPE 仍将占据主导地位,不断改进其基频和针对百万代币上下文的扩展,并继续研究它如何与注意力行为相互作用。
现实世界的实施
为 Llama、Mistral 和 Qwen 建模它们的 token 顺序感,无需单独的位置嵌入
通过插值或 YaRN 将模型的可用上下文从几千个标记扩展到数万个标记
帮助代码模型跟踪长文件中括号、函数和引用之间的相对距离
在问题和证据之间的相对位置很重要的情况下支持长文档问答
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Rotary Position Embeddings?
旋转位置嵌入 (RoPE) 通过将查询向量和键向量旋转与位置成比例的角度,对每个标记在序列中的位置进行编码。这个优雅的技巧让 Transformer 理解相对距离并优雅地扩展到更长的上下文。
RoPE 如何将位置信息注入变压器?
RoPE 将查询向量和密钥向量旋转与位置成比例的角度,而不是添加单独的位置向量。
RoPE 修改了注意力计算的哪些部分?
RoPE 将其旋转应用于查询和键向量,而保持值向量不变。
为什么不同维度对在 RoPE 中以不同频率旋转?
就像时钟指针以不同的速度滴答作响一样,不同的频率让一些对编码短程顺序,而另一些对编码长程位置。
位置插值、NTK 感知缩放和 YaRN 等技术的目标是什么?
这些方法重新调整 RoPE 的旋转频率,以便模型可以处理比原始训练长度更长的上下文。