線性注意力和表演者核
線性注意力以隨序列長度線性縮放的數學技巧取代了 Transformers 中的二次 softmax 注意力。
概述
Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.
深入探討
標準 Transformer 注意力計算每對標記之間的分數,花費的時間和記憶體隨著序列長度的平方 (O(n^2)) 增長。線性注意力重寫了計算,因此成本僅線性增長 (O(n))。關鍵觀念:softmax注意力是softmax(QK^T)V,但如果用核心特徵圖phi取代softmax,你會得到phi(Q)(phi(K)^T V)。由於矩陣乘法是關聯的,因此您首先計算 phi(K)^T V (一個小的 d×d 矩陣),完全避免了巨大的 n×n 分數矩陣。 Performer,來自 2020 年的 Google,使用 FAVOR+(透過正正交隨機特徵進行快速注意力)使其成為真正的 softmax 的忠實近似,繪製隨機投影以保持內核估計的無偏和穩定。
技術洞察
Performer 的 FAVOR+ 使用正隨機特徵來近似 softmax 內核 exp(q.k):它透過包裹在指數中的隨機高斯投影映射查詢和鍵,保證非負注意力權重並避免早期估計器的數值不穩定性。使用正交隨機特徵可以減少變異數。至關重要的是,n×n 注意力矩陣從未具體化,因此記憶體從二次下降到線性,從而支援數萬個標記的序列。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
線性注意力和表演者內核的未來
純線性注意力通常在品質上落後於 softmax,因此該領域正在向混合型方向發展:狀態空間模型 (Mamba)、門控線性注意力以及將一些全注意力層與許多線性注意力層混合在一起的架構。隨著上下文視窗向數百萬個令牌推進,線性和次二次機制對成本越來越有吸引力,並且正在重新審視循環式線性注意力以實現高效的流式推理和設備上模型。
現實世界的實施
處理長基因組或蛋白質序列,其中完全二次注意力會耗盡 GPU 內存
使用 Performer 風格的主幹,對很長的報告進行文檔級摘要,無需分塊
高效的長格式音訊或時間序列建模,其中序列跨越數萬個步驟
透過用線性注意力變體取代一些 softmax 層來降低長上下文聊天模型中的推理成本
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Linear Attention and Performer Kernels quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Linear Attention and Performer Kernels?
線性注意力以隨序列長度線性縮放的數學技巧取代了 Transformers 中的二次 softmax 注意力。 Performer 是一種具有里程碑意義的方法,它使用隨機特徵內核來近似 softmax,使得非常長的序列在計算上是可以承受的。
為什麼標準的 softmax 注意力隨序列長度的變化很差?
Softmax 注意力比較每對標記,產生 n×n 分數矩陣,因此成本成長為 O(n^2)。
什麼數學屬性可以讓線性注意力避免 n×n 矩陣?
由於矩陣乘法是結合律,因此您可以先計算 phi(K)^T V(一個小的 d×d 矩陣),而不是 phi(Q)phi(K)^T。
Performer的FAVOR+機制大概是怎麼樣的?
FAVOR+使用正正交隨機特徵來近似指數softmax內核,而不形成完整的注意力矩陣。
為什麼 Performer 使用正隨機特徵而不是早期的三角特徵?
正特徵使內核估計保持非負值,避免了困擾早期 sin/cos 特徵圖的不穩定和負值。
序列長度 n 中表演者式線性注意力的近似複雜度是多少?
透過重新排序計算並且從不建立 n×n 矩陣,成本隨序列長度線性縮放。