語言人工智慧指南

多頭潛在註意力

多頭潛在註意力(MLA)是 DeepSeek-V2 中引入的一種注意力機制,它將佔用記憶體的鍵值快取壓縮為一個小的共享潛在向量。

閱讀時間約2分鐘最後更新

概述

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

深入探討

當轉換器產生文字時,它會將每個過去標記的鍵和值向量儲存在「KV 快取」中。該快取隨著上下文長度而增長,並在推理期間主導記憶體使用。 MLA 將許多全尺寸鍵/值向量替換為每個令牌的單一低秩潛在向量,然後將其動態投影回每個頭的鍵和值。由於僅緩存緊湊的潛在變量,DeepSeek-V2 報告稱,與標準多頭注意力機制相比,KV 快取記憶體減少了 90% 以上,從而實現了更長的上下文和更大的批量大小。至關重要的是,上投影矩陣可以折疊成其他權重,因此 MLA 可以實現這種壓縮,而建模品質幾乎沒有或沒有可測量的損失。

技術洞察

MLA 執行低秩聯合壓縮:每個標記的隱藏狀態被投影到一個小的潛在向量,並且單獨的上投影矩陣重建每個頭的鍵和值。一個聰明的技巧是將上投影權重「吸收」到查詢和輸出投影中,因此模型在推理過程中永遠不會實現完整的鍵/值。旋轉位置嵌入是透過解耦的關鍵路徑來處理的,因為旋轉不能以相同的方式被吸收,從而保留位置資訊。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

多頭潛在註意力的未來

MLA 幫助 DeepSeek-V2 和 V3 實現大規模服務的經濟性,隨著團隊追求更便宜的長上下文推理,該技術正在傳播。預計 MLA 風格的潛在壓縮將與稀疏專家混合層、量化快取和未來開放模型中的推測解碼相結合。研究人員還在探索在品質下降之前潛在維度可以縮小多少,以及相同的低等級想法是否可以在訓練期間壓縮注意力,而不僅僅是推理。

現實世界的實施

為 DeepSeek-V2/V3 聊天模型提供服務,每個請求的 GPU 記憶體佔用量顯著減少

運行長文檔問答,否則大型 KV 快取會耗盡 VRAM

在固定 GPU 上增加推理批次大小,因為每個序列只儲存一個微小的潛在向量

在商用硬體上為檢索增強助理啟用更長的上下文窗口

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

多查詢注意力

常見問題

What is Multi-Head Latent Attention?

多頭潛在註意力(MLA)是 DeepSeek-V2 中引入的一種注意力機制,它將佔用記憶體的鍵值快取壓縮為一個小的共享潛在向量。它允許大型語言模型以少得多的 GPU 記憶體運行,同時保持品質接近標準關注度。

多頭潛在註意力旨在減少的主要問題是什麼?

MLA 的目標是 KV 緩存,它隨著上下文長度的增長而增長,並在文字生成期間佔據記憶體。

MLA如何收縮KV快取?

MLA 為每個標記快取一個緊湊的潛在向量,並透過上投影從中重建鍵和值。

哪個模型首先引入了多頭潛在註意力?

MLA由DeepSeek在其DeepSeek-V2模型中引入,並被引入到DeepSeek-V3中。

為什麼 MLA 需要一個單獨的「解耦」路徑來進行旋轉位置嵌入?

旋轉變換不能被吸收到其他權重矩陣中,因此MLA保留了一個小的解耦關鍵組件來攜帶位置資訊。

與標準多頭注意力相比,DeepSeek-V2 從 MLA 報告的 KV 快取記憶體減少了大約多少?

DeepSeek-V2 報告稱,KV 快取記憶體減少了 90% 以上,從而實現了更長的上下文和更大的批次。