语言人工智能指南

RWKV 线性注意力

RWKV 是一种像 Transformer 一样训练的架构,但像循环网络一样运行推理,提供线性时间、恒定内存生成。

阅读时间:2分钟最后更新

概述

It reformulates attention so there is no quadratic cost and no growing key-value cache.

深入探讨

RWKV(发音为“RwaKuv”)代表“Receptance”、“Weight”、“Key”、“Value”,是其四个核心要素。它主要是作为一个开放的、社区驱动的项目而创建的,由 Bo Peng 领导。目标是保持 Transformer 的并行可训练性,同时消除其昂贵的推理。标准注意力存储一个键值缓存,该缓存随每个令牌而增长,并将每个新令牌与所有先前的令牌进行比较。相反,RWKV 向前携带一个小的固定大小的隐藏状态,并使用时间衰减规则对其进行更新,以便较旧的信息顺利消失。在训练过程中,它可以以可并行的形式展开;在生成过程中,它充当 RNN,以恒定成本一次生成一个代币。这使得它对于长上下文和资源有限的部署具有吸引力。

技术洞察

RWKV 用线性注意力式递归取代了 softmax 点积注意力。学习的每通道时间衰减权重 (W) 控制过去的键失去影响的速度,接收门 (R) 决定要读出多少累积状态,键/值向量提供运行加权和。因为每个步骤仅取决于先前的状态,所以内存保持不变,并且每个令牌的工作量不会随着序列长度而增长。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

RWKV 线性注意力的未来

RWKV 通过版本(v4、v5 Eagle、v6 Finch 及更高版本)快速迭代,缩小了与 Transformers 的质量差距,同时保持线性成本。预计开放多语言模型、恒定内存至关重要的边缘和 CPU 部署以及混合设计将持续增长。其完全循环推理使其成为流应用程序和非常长的上下文的有力候选者,否则键值缓存将爆炸。

现实世界的实施

在 CPU 或低内存设备上运行功能强大的开源聊天模型,每个令牌具有恒定的内存

流式文本生成,一次生成一个令牌,无需不断增长的缓存

长文档处理,其中 Transformer 的键值缓存将非常大

需要高效、开放许可架构的社区和多语言模型项目

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RWKV Linear Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

线性注意力和表演者核

常见问题

What is RWKV Linear Attention?

RWKV 是一种像 Transformer 一样训练的架构,但像循环网络一样运行推理,提供线性时间、恒定内存生成。它重新表述了注意力,因此没有二次成本,也没有不断增长的键值缓存。

RWKV 的主要资产是什么?

RWKV 的设计目标是并行 Transformer 式训练与循环、恒定成本推理相结合。

RWKV 中的字母代表什么?

RWKV 以其四个组成部分命名:Receptance、Weight、Key 和 Value。

RWKV 如何在生成过程中保持内存恒定?

与 RNN 一样,RWKV 每一步都会更新固定大小的状态,因此内存不会随着序列长度而增长。

时间衰减权重 (W) 起什么作用?

学习到的每通道衰减权重决定了过去的按键在运行状态下衰减的速度。

与softmax注意力相比,RWKV的线性注意力循环避免了什么?

通过使用递归,RWKV 回避了将每个代币与其他每个代币进行比较,从而消除了二次成本。