块稀疏和本机稀疏注意力
块稀疏和原生稀疏注意力让 Transformer 只关注长序列中最相关的块,而不是每个标记,从而大幅削减了标准注意力的二次成本。
概述
This is what makes efficient long-context models practical on real hardware.
深入探讨
标准的自注意力将每个标记与其他每个标记进行比较,因此成本随着序列长度呈二次方增长,对于很长的文档来说变得令人望而却步。稀疏注意力将每个标记限制为其他标记的子集。块稀疏方法将序列划分为块,并仅针对选定的块对计算注意力,从而有效地映射到 GPU 张量核心。 DeepSeek 的原生稀疏注意力 (NSA) 更进一步:它是可端到端训练的且与硬件对齐,结合了三个分支、粗粒度令牌压缩、最重要块的细粒度选择以及本地上下文的滑动窗口。由于稀疏模式是在预训练期间学习的,而不是事后附加的,因此 NSA 在保持准确性的同时,在长序列上提供大幅加速。
技术洞察
NSA 通过三个并行路径处理键和值,然后将它们与学习门合并。压缩将令牌块聚合成摘要表示;选择分数块并仅保留排名靠前的块以引起充分关注;滑动窗口覆盖附近的标记。块级操作与 GPU 内存访问和张量核心吞吐量保持一致,因此理论上的 FLOP 节省转化为训练和推理过程中的实际挂钟加速,特别是对于内存限制的解码步骤。
战略影响
成本与预算
多年来,架构决策决定着性能和运营成本。
更清晰的判决
技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。
质量控制
更好的工程选择可以减少生产中的可靠性事故。
块稀疏和本机稀疏注意力的未来
可训练的、硬件感知的稀疏性正在成为在不增加成本的情况下获得百万代币上下文的途径。预计稀疏注意力将与内核和加速器共同设计,与线性注意力和状态空间思想相结合,并在前沿长上下文和推理模型中采用。随着模式变得可学习和动态,模型将自适应地为每个查询分配注意力预算,基准将越来越多地衡量长序列的解码吞吐量,而不仅仅是原始质量。
现实世界的实施
在整个代码库或长期法律合同上运行模型,其中的全部注意力会耗尽 GPU 内存。
DeepSeek 的 NSA 加速了预训练和长上下文推理,同时匹配或超越全注意力准确度。
通过关注压缩块摘要和本地相关段落来总结书本长度的文档。
通过将每个令牌限制为排名最高的块,加速长上下文聊天助手的解码步骤受内存限制。
风险与防护栏
优化一项基准测试可以隐藏更广泛的系统弱点。
基础设施和维护成本常常被低估。
随着系统变得更加复杂,安全性和可观察性差距可能会扩大。
实施路线图
在实施之前定义延迟、质量和成本目标。
在实际负载和数据条件下进行基准测试。
仪器监控错误、漂移和用户影响。
在扩展之前准备回滚和事件响应路径。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Block-Sparse and Native Sparse Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Block-Sparse and Native Sparse Attention?
块稀疏和原生稀疏注意力让 Transformer 只关注长序列中最相关的块,而不是每个标记,从而大幅削减了标准注意力的二次成本。这就是高效的长上下文模型在真实硬件上实用的原因。
为什么标准自注意力对于长序列来说代价昂贵?
每个标记都涉及其他每个标记,因此计算和内存按序列长度的平方进行缩放。
块稀疏注意力的核心思想是什么?
该序列被分成块,并且仅针对选定的块对计算注意力,这也很好地映射到 GPU 张量核心上。
是什么让原生稀疏注意力(NSA)与许多早期的稀疏方法不同?
NSA 在预训练期间学习其稀疏模式,并旨在与硬件保持一致,因此它在快速运行的同时保持准确性。
NSA 将哪三个分支组合起来作为其键和值?
NSA 融合了粗略的令牌压缩、细粒度的块选择和使用学习门的局部滑动窗口。
为什么 NSA 使用块级操作而不是任意令牌级稀疏性?
块级访问模式适合 GPU 硬件,因此理论上的 FLOP 节省变成了实际的挂钟加速。