語言人工智慧指南

稀疏注意力模式

稀疏注意力讓 Transformer 變得更便宜,因為它讓每個代幣只專注於精心選擇的其他代幣的子集而不是全部。

閱讀時間約2分鐘最後更新

概述

This trades a little global reach for big savings in memory and compute on long sequences.

深入探討

完全自註意力將每個標記與其他每個標記進行比較,因此成本隨著序列長度的平方而增長,這對於長文檔來說變得痛苦。稀疏注意力用結構化模式取代了密集模式。常見的設計包括滑動視窗(局部)注意力,其中每個代幣只看到附近的鄰居;大步或擴張的模式向前跳躍以便宜地到達遙遠的背景;以及全球代幣,一些特殊的位置,涉及一切,一切都涉及,充當資訊中心。 Longformer、BigBird 和 Sparse Transformer 等模型將這些模型結合起來,因此連接總數大致呈線性增長,而不是呈二次方增長,從而實現了數千到數萬個令牌的上下文。

技術洞察

稀疏注意力不是完整的 N×N 注意力矩陣,而是只計算選定的條目,通常是本地視窗和一些全域行和列的並集。 BigBird 著名地證明,結合隨機、視窗和全局連接可以保留充分注意力的理論表達能力,同時將複雜性從 O(N 平方) 降低到 O(N)。高效的核心完全跳過屏蔽的條目,而不是計算然後將它們歸零。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

稀疏注意力模式的未來

稀疏注意力仍然是長上下文建模的核心,越來越多地與 FlashAttention 等優化內核以及學習或動態稀疏性相結合,以選擇每個輸入要關注的標記。隨著上下文視窗擴展到數百萬個標記,混合堆疊混合了稀疏層、密集層和狀態空間層。期望硬體感知的稀疏內核和基於路由的注意力能夠不斷降低讀取很長輸入的成本。

現實世界的實施

Longformer 使用滑動視窗和全局注意力一次處理整篇科學論文或法律文檔

BigBird 透過線性縮放注意力處理長文檔問答和基因組序列

總結書本長度的文本,如果全神貫注會耗盡 GPU 內存

使用 Global Hub 令牌在數千個令牌之間路由關鍵資訊的檢索和長上下文聊天系統

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sparse Attention Patterns quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

塊稀疏和本機稀疏注意力

常見問題

What is Sparse Attention Patterns?

稀疏注意力讓 Transformer 變得更便宜,因為它讓每個代幣只專注於精心選擇的其他代幣的子集而不是全部。這會犧牲一點全球影響力,以節省大量記憶體和長序列計算。

為什麼在長序列上完全自註意力會很昂貴?

充分關注將每個令牌與其他每個令牌進行比較,從而給出 O(N 平方) 的時間和記憶體成本。

什麼是滑動視窗(局部)注意力?

本地註意力將每個令牌的視圖限制在周圍令牌的固定視窗內,從而大大降低了成本。

稀疏注意力中「全局代幣」的目的是什麼?

一些全域令牌連接到所有位置,讓資訊廉價地在整個序列中流動。

哪個模型證明了隨機、視窗和全局注意力的結合可以保持全注意力的表達能力?

BigBird 顯示其稀疏模式是序列函數的通用逼近器,同時大致線性縮放。

在精心設計的稀疏注意力中,連接數量大致如何擴展?

透過限制與本地視窗的連接以及一些全局鏈接,總連接數呈線性增長。