基础知识指南

状态空间模型和 Mamba

状态空间模型(SSM)是通过压缩隐藏状态传递信息的序列模型,随序列长度线性缩放,而不是像注意力那样二次缩放。

阅读时间:2分钟最后更新

概述

Mamba is the 2023 architecture that made SSMs competitive with Transformers by letting that state-update process depend on the input, unlocking efficient handling of very long sequences.

深入探讨

状态空间模型逐步处理序列,维护一个隐藏状态,总结迄今为止所看到的一切。在每个位置,它通过学习矩阵(通常标记为 A、B、C)控制的线性递归更新状态并发出输出。像 S4 这样的结构化 SSM 的突破表明,这种递归可以作为长卷积展开,并在并行硬件上进行有效训练。 Mamba 的关键创新在于选择性:它使 B、C 和步长参数成为当前输入的函数,因此模型可以动态决定每个标记要记住什么和忽略什么。这种输入依赖性牺牲了简单的卷积,但通过硬件感知的并行扫描来恢复,从而提供线性时间训练和恒定内存、快速推理。

技术洞察

定义的张力是并行性与选择性。经典的 SSM 使用固定的、与输入无关的矩阵,这使得递归可以作为一个大卷积来计算——极其并行,但无法有选择地过滤内容。 Mamba 的选择性参数打破了这种卷积技巧,因此作者构建了一个自定义并行扫描内核,将状态保留在快速 GPU SRAM 中,并避免在慢速内存中实现它,从而在获得内容感知推理的同时保持速度。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

状态空间模型和 Mamba 的未来

Mamba 及其后继者(Mamba-2、混合 Jamba 模型)正在进军序列极长的领域:基因组学、高分辨率音频和百万个令牌的环境,其中注意力的二次成本令人望而却步。主导趋势是混合架构,将几个注意力层与许多 Mamba 层交织在一起,捕获注意力的精确回忆,同时保持大多数计算的线性。预计 SSM 将成为长上下文工具包中的标准组件,而不是大规模的 Transformer 替代品。

现实世界的实施

在基因组学中对数十万个碱基对长的 DNA 序列进行建模,其中 Transformer 注意力在计算上是不可行的。

以高采样率处理语音和音乐任务的原始音频波形,无需下采样。

为 Jamba 等混合大型语言模型提供支持,该模型混合了 Mamba 和注意力层,以实现高效的长上下文理解。

在边缘设备上进行流式推理,其中每步的恒定内存和快速令牌生成比峰值精度更重要。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录状态空间模型和 Mamba 在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the State Space Models and Mamba quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Mamba 和选择性状态空间

常见问题

What is State Space Models and Mamba?

状态空间模型(SSM)是通过压缩隐藏状态传递信息的序列模型,随序列长度线性缩放,而不是像注意力那样二次缩放。 Mamba 是 2023 年的架构,通过让状态更新过程依赖于输入,从而实现对超长序列的高效处理,从而使 SSM 与 Transformer 竞争。

与标准自注意力相比,状态空间模型如何随序列长度缩放?

SSM 以线性递归方式处理序列,并线性缩放长度,而自注意力则将每个标记与其他标记进行比较,并以二次方缩放。

Mamba 为 S4 等之前的结构化 SSM 添加的核心创新是什么?

Mamba 引入了选择性 SSM,其 B、C 和步长参数是输入的函数,让模型选择每个标记要记住的内容。

为什么 Mamba 需要自定义硬件感知并行扫描?

依赖于输入的(选择性)参数意味着递归不再是单个固定卷积,因此并行扫描内核可以恢复训练速度。

什么架构趋势将 Mamba 与 Transformers 结合起来用于长上下文模型?

像 Jamba 这样的混合体将一些注意力层(为了精确召回)与许多线性时间 Mamba 层混合在一起,平衡了准确性和效率。