語言人工智慧指南

Mamba 和選擇性狀態空間

Mamba 是一種基於狀態空間模型 (SSM) 構建的序列模型,可在線性時間內處理文本,為 Transformer 的二次注意力提供快速替代方案。

閱讀時間約2分鐘最後更新

概述

Its key trick is making the model selectively decide what to remember and forget based on the input itself.

深入探討

Mamba 由 Albert Gu 和 Tri Dao 於 2023 年底推出,建立在結構化狀態空間模型之上。經典的 SSM 將序列的整個歷史壓縮為固定大小的隱藏狀態並逐步更新它,就像複雜的循環網路一樣。突破在於選擇性:Mamba 使 SSM 的參數(保留多少、放出多少)取決於目前的 token,因此模型可以專注於相關單字並忽略填充詞。這使得一個固定大小的狀態就像內容感知記憶體一樣。因為它避免了將每個標記與其他標記進行比較,所以 Mamba 隨序列長度線性縮放,並在非常長的輸入(如基因組、音訊或書籍長度的文字)上保持快速。

技術洞察

狀態空間模型透過由矩陣 A、B、C 和步長增量定義的連續線性系統將輸入序列對應到輸出。早期的 SSM 保持這些固定,從而允許快速卷積視圖。 Mamba 對輸入創建 B、C 和 delta 函數,這打破了卷積捷徑,因此它轉而使用快速 GPU SRAM 中保存的硬體感知並行掃描來恢復速度,同時獲得依賴於輸入的內存。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

Mamba 與選擇性狀態空間的未來

Mamba 及其後繼者 Mamba-2 正在推動混合架構,將幾個注意力層與許多 SSM 層交織在一起,從而發揮兩者的優勢。 SSM 預計將出現在長上下文助理、記憶體受限的裝置模型以及 DNA 和音訊等非文字領域。研究正在探索純 SSM 是否可以在需要精確回憶的任務上與 Transformer 相媲美,以及它們是否可以擴展到最大的模型尺寸。

現實世界的實施

對極長的 DNA 序列進行建模,而百萬代幣的 Transformer 成本太高

為長上下文語言助手提供支持,無需截斷即可總結整本書

即時音訊生成和語音建模,可有效處理原始波形

設備上或邊緣部署,其中較小的固定大小的循環狀態與不斷增長的注意力緩存相比可以節省內存

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mamba and Selective State Spaces quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

狀態空間模型和 Mamba

常見問題

What is Mamba and Selective State Spaces?

Mamba 是一種基於狀態空間模型 (SSM) 構建的序列模型,可在線性時間內處理文本,為 Transformer 的二次注意力提供快速替代方案。它的關鍵技巧是讓模型根據輸入本身有選擇地決定記住和忘記什麼。

與標準 Transformer 相比,Mamba 的主要運算優勢是什麼?

Mamba 避免了所有對標記的比較,因此它的成本隨著序列長度線性增長,而不是像注意力那樣二次增長。

《曼巴》中的「選擇性」一詞指的是什麼?

選擇性意味著 B、C 和 delta 等參數成為當前輸入的函數,從而提供內容感知記憶體。

狀態空間模型如何表示序列的歷史?

SSM 是循環式模型,將過去折疊成固定大小的狀態,類似 RNN。

為什麼 Mamba 不能使用早期 SSM 所使用的快速卷積捷徑?

卷積視圖需要固定(時不變)參數;依賴輸入的參數打破了這一點,因此 Mamba 使用並行掃描。

儘管失去了卷積捷徑,Mamba 使用什麼技術來保持速度?

Mamba 使用硬體感知選擇性掃描,將中間狀態保留在快速 SRAM 中以恢復吞吐量。