ALiBi 位置偏差
ALiBi(带有线性偏差的注意力)是一种巧妙的方法,可以为 Transformer 提供词序感,而无需传统的位置嵌入。
概述
It lets a model trained on short text handle much longer inputs at inference time.
深入探讨
Transformer 没有内置的词序概念,因此它们需要一种对位置进行编码的方法。经典方法将位置嵌入添加到标记向量中。 Press、Smith 和 Lewis 在 2021 年推出的 ALiBi 完全抛弃了这些。相反,它直接推动注意力分数:当查询标记查看关键标记时,ALiBi 会减去与它们之间的距离成比例的惩罚。相距较远的标记会受到更大的惩罚,因此模型自然更喜欢附近的上下文。每个注意力头都有自己固定的惩罚斜率,所以有些头看局部,而另一些头看更远。由于偏差只是距离的函数,ALiBi 可以优雅地推断出比训练中看到的序列长得多的序列。
技术洞察
对于位置 i 处的查询和位置 j 处的键,ALiBi 在 softmax 之前将 m * (j - i) 添加到原始注意力分数,其中 m 是头部特定常数(斜率形成几何序列,如 1/2、1/4、1/8)。由于因果注意力中 j 小于或等于 i,因此该项为零或负数,从而惩罚远处的标记。没有学习参数,也没有添加嵌入,因此唯一的开销是预先计算的偏差矩阵。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
ALiBi 仓位偏差的未来
ALiBi 证明了相对的、基于距离的偏差在长度泛化方面击败了绝对位置嵌入,并且这个想法现在渗透到了现代的长上下文设计中。最近的一些模型更倾向于旋转嵌入 (RoPE),但 ALiBi 在极端外推很重要的情况下仍然很受欢迎,并被用于 BLOOM 和 MPT 等模型中。随着实验室将上下文窗口推向数百万个令牌,而无需从头开始重新训练,预计将继续进行混合实验,将距离偏差与 RoPE 缩放相结合。
现实世界的实施
依靠 ALiBi 的推断,在 1,024 个令牌示例上训练聊天机器人,但将其部署在 4,096 个令牌文档上,无需重新训练。
BLOOM 176B 多语言模型,采用 ALiBi 进行仓位处理。
MosaicML 的 MPT 模型,使用 ALiBi 在推理时有效地宣传无限的上下文长度。
总结超出模型原始训练长度的长期法律合同,其中邻近上下文偏差使注意力保持一致。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ALiBi Position Bias quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is ALiBi Position Bias?
ALiBi(带有线性偏差的注意力)是一种巧妙的方法,可以为 Transformer 提供词序感,而无需传统的位置嵌入。它允许在短文本上训练的模型在推理时处理更长的输入。
ALiBi 代表什么?
ALiBi 是 Attention with Linear Biases 的缩写,因其添加到注意力分数中的线性惩罚而得名。
ALiBi如何惩罚远程代币?
ALiBi 从注意力分数中减去与查询键距离成比例的值,因此距离越远的标记权重越小。
ALiBi最著名的实际优势是什么?
由于偏差仅取决于距离,因此在短序列上训练的模型可以在推理时处理更长的序列。
注意力头之间的线性偏差有什么不同?
ALiBi 为每个头分配一个不同的固定斜率(例如 1/2、1/4、1/8),因此不同的头参与不同的范围。
与传统的位置嵌入相比,ALiBi 增加了多少学习参数?
ALiBi 没有引入新的学习参数;人均斜率是预先确定的常数。