Mamba 和选择性状态空间
Mamba 是一种基于状态空间模型 (SSM) 构建的序列模型,可在线性时间内处理文本,为 Transformer 的二次注意力提供快速替代方案。
概述
Its key trick is making the model selectively decide what to remember and forget based on the input itself.
深入探讨
Mamba 由 Albert Gu 和 Tri Dao 于 2023 年末推出,建立在结构化状态空间模型之上。经典的 SSM 将序列的整个历史压缩为固定大小的隐藏状态并逐步更新它,就像复杂的循环网络一样。突破在于选择性:Mamba 使 SSM 的参数(保留多少、放出多少)取决于当前的 token,因此模型可以专注于相关单词并忽略填充词。这使得一个固定大小的状态就像内容感知内存一样。因为它避免了将每个标记与其他标记进行比较,所以 Mamba 随序列长度线性缩放,并在非常长的输入(如基因组、音频或书籍长度的文本)上保持快速。
技术洞察
状态空间模型通过由矩阵 A、B、C 和步长增量定义的连续线性系统将输入序列映射到输出。早期的 SSM 保持这些固定,从而允许快速卷积视图。 Mamba 对输入创建 B、C 和 delta 函数,这打破了卷积捷径,因此它转而使用快速 GPU SRAM 中保存的硬件感知并行扫描来恢复速度,同时获得依赖于输入的内存。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
Mamba 和选择性状态空间的未来
Mamba 及其后继者 Mamba-2 正在推动混合架构,将几个注意力层与许多 SSM 层交织在一起,从而发挥两者的优势。 SSM 有望出现在长上下文助手、内存受限的设备模型以及 DNA 和音频等非文本领域中。研究正在探索纯 SSM 是否可以在需要精确回忆的任务上与 Transformer 相媲美,以及它们是否可以扩展到最大的模型尺寸。
现实世界的实施
对极长的 DNA 序列进行建模,而百万代币的 Transformer 成本太高
为长上下文语言助手提供支持,无需截断即可总结整本书
实时音频生成和语音建模,可有效处理原始波形
设备上或边缘部署,其中较小的固定大小的循环状态与不断增长的注意力缓存相比可以节省内存
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mamba and Selective State Spaces quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Mamba and Selective State Spaces?
Mamba 是一种基于状态空间模型 (SSM) 构建的序列模型,可在线性时间内处理文本,为 Transformer 的二次注意力提供快速替代方案。它的关键技巧是让模型根据输入本身有选择地决定记住和忘记什么。
与标准 Transformer 相比,Mamba 的主要计算优势是什么?
Mamba 避免了所有对标记的比较,因此它的成本随着序列长度线性增长,而不是像注意力那样二次增长。
《曼巴》中的“选择性”一词指的是什么?
选择性意味着 B、C 和 delta 等参数成为当前输入的函数,从而提供内容感知内存。
状态空间模型如何表示序列的历史?
SSM 是循环式模型,将过去折叠成固定大小的状态,类似于 RNN。
为什么 Mamba 不能使用早期 SSM 使用的快速卷积捷径?
卷积视图需要固定(时不变)参数;依赖于输入的参数打破了这一点,因此 Mamba 使用并行扫描。
尽管失去了卷积捷径,Mamba 使用什么技术来保持速度?
Mamba 使用硬件感知选择性扫描,将中间状态保留在快速 SRAM 中以恢复吞吐量。