技術指南

塊稀疏和本機稀疏注意力

塊稀疏和原生稀疏注意力讓 Transformer 只專注於長序列中最相關的塊,而不是每個標記,從而大幅削減了標準注意力的二次成本。

閱讀時間約2分鐘最後更新

概述

This is what makes efficient long-context models practical on real hardware.

深入探討

標準的自註意力將每個標記與其他每個標記進行比較,因此成本隨著序列長度呈二次方增長,對於很長的文件來說變得令人望而卻步。稀疏注意力將每個標記限制為其他標記的子集。區塊稀疏方法將序列劃分為區塊,並僅針對選定的區塊對計算注意力,從而有效地映射到 GPU 張量核心。 DeepSeek 的原生稀疏注意力 (NSA) 更進一步:它是可端到端訓練的且與硬體對齊,結合了三個分支、粗粒度令牌壓縮、最重要塊的細粒度選擇以及本地上下文的滑動視窗。由於稀疏模式是在預訓練期間學習的,而不是事後附加的,因此 NSA 在保持準確性的同時,在長序列上提供大幅加速。

技術洞察

NSA 透過三個平行路徑處理鍵和值,然後將它們與學習閘合併。壓縮將令牌塊聚合成摘要表示;選擇分數塊並僅保留排名靠前的塊以引起充分關注;滑動視窗覆蓋附近的標記。區塊級操作與 GPU 記憶體存取和張量核心吞吐量保持一致,因此理論上的 FLOP 節省轉化為訓練和推理過程中的實際掛鐘加速,特別是對於記憶體限制的解碼步驟。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

塊稀疏和本機稀疏注意力的未來

可訓練的、硬體感知的稀疏性正在成為在不增加成本的情況下獲得百萬代幣上下文的途徑。預計稀疏注意力將與內核和加速器共同設計,與線性注意力和狀態空間思想相結合,並在前沿長上下文和推理模型中採用。隨著模式變得可學習和動態,模型將自適應地為每個查詢分配注意力預算,基準將越來越多地衡量長序列的解碼吞吐量,而不僅僅是原始品質。

現實世界的實施

在整個程式碼庫或長期法律合約上運行模型,其中的全部注意力會耗盡 GPU 記憶體。

DeepSeek 的 NSA 加速了預訓練和長上下文推理,同時匹配或超越全注意力準確度。

透過專注於壓縮塊摘要和本地相關段落來總結書本長度的文件。

透過將每個令牌限制為排名最高的區塊,加速長上下文聊天助理的解碼步驟受記憶體限制。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Block-Sparse and Native Sparse Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

稀疏注意力模式

常見問題

What is Block-Sparse and Native Sparse Attention?

塊稀疏和原生稀疏注意力讓 Transformer 只專注於長序列中最相關的塊,而不是每個標記,從而大幅削減了標準注意力的二次成本。這就是為什麼高效的長上下文模型在真實硬體上實用的原因。

為什麼標準自註意力對於長序列來說代價昂貴?

每個標記都涉及其他每個標記,因此計算和記憶體按序列長度的平方進行縮放。

塊稀疏注意力的核心思想是什麼?

該序列被分成區塊,並且僅針對選定的區塊對計算注意力,這也很好地映射到 GPU 張量核心上。

是什麼讓原生稀疏注意力(NSA)與許多早期的稀疏方法不同?

NSA 在預訓練期間學習其稀疏模式,並旨在與硬體保持一致,因此它在快速運行的同時保持準確性。

NSA 將哪三個分支組合起來作為其鍵和值?

NSA 融合了粗略的令牌壓縮、細粒度的塊選擇和使用學習門的局部滑動視窗。

為什麼 NSA 使用區塊級操作而不是任意令牌級稀疏性?

區塊級存取模式適合 GPU 硬件,因此理論上的 FLOP 節省變成了實際的掛鐘加速。