語言人工智慧指南

Jamba混合變壓器-Mamba型號

Jamba 是 AI21 Labs 的大型語言模型,它將 Transformer 注意力層與 Mamba 狀態空間層(加上專家混合層)交織在一起,以在不犧牲 Transformer 品質的情況下獲得長上下文效率。

閱讀時間約2分鐘最後更新

概述

It matters because it shows hybrid architectures can beat pure Transformers on memory and throughput at long sequence lengths.

深入探討

隨著上下文的增長,純 Transformer 會付出二次方的注意力成本,並且它們的鍵值快取會隨著序列長度的增加而膨脹。像 Mamba 這樣的純狀態空間模型可以線性擴展並保持固定大小的循環狀態,但歷史上對某些任務的注意力滯後。 Jamba 融合了兩者:它堆疊的塊中,大多數層是 Mamba(廉價、線性,非常適合長序列),而少量層是標準注意力(在精確回憶和上下文推理方面能力很強)。它還添加了專家混合 (MoE) 層以增加容量,同時保持活動參數適度。第一個 Jamba 發佈時帶有 256K 令牌上下文窗口,並且由於其 KV 快取小得多,因此與同類 Transformer 相比,單一 GPU 可以容納更多的上下文。

技術洞察

Mamba 是一種選擇性狀態空間模型:它不是關注每個過去的標記,而是維護一個在序列上線性更新的壓縮循環狀態,並透過依賴輸入的閘控來決定保留或忘記什麼。 Jamba 在許多 Mamba 層中散佈了一些全注意力層,因此模型保留注意力的精確遠程查找,同時大部分計算和內存保持線性,並且 MoE 路由僅激活每個令牌的專家子集。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

Jamba混合變壓器的未來-Mamba模型

混合注意力加狀態空間設計正在成為高效長上下文模型的主要配方,而 Jamba 幫助普及了該模式。預計更多開放和前沿模型將採用混合堆疊,細化注意力與 SSM 的比率,並將其與 MoE 和 KV 緩存技巧相結合。隨著上下文需求增長到數百萬個令牌,狀態空間層的線性記憶體優勢使得混合對於設備上和成本敏感的部署特別有吸引力。

現實世界的實施

在無法容納類似 Transformer 的 KV 快取的單一 GPU 上處理 256K 令牌輸入,例如長法律檔案或大型程式碼儲存庫

提供高吞吐量長上下文聊天,其中 Mamba 的固定狀態可隨著對話的增長保持記憶體平穩

對直接填充到上下文中的非常大的知識庫進行文件分析和檢索增強生成

運行開放權重長上下文法學碩士(Jamba 是隨開放權重一起發布的)以研究混合架構

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jamba Hybrid Transformer-Mamba Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

狀態空間模型和 Mamba

常見問題

What is Jamba Hybrid Transformer-Mamba Models?

Jamba 是 AI21 Labs 的大型語言模型,它將 Transformer 注意力層與 Mamba 狀態空間層(加上專家混合層)交織在一起,以在不犧牲 Transformer 品質的情況下獲得長上下文效率。這很重要,因為它表明混合架構可以在長序列長度的記憶體和吞吐量方面擊敗純 Transformer。

Jamba 交錯哪兩種核心層型?

Jamba 的定義特徵是將 Mamba 狀態空間層與少量 Transformer 注意力層堆疊在一起。

Jamba 使用什麼附加技術來增加容量,同時保持較低的活動參數?

Jamba 新增了 MoE 層,因此每個代幣只有一部分專家處於活動狀態,從而在不按比例增加計算的情況下增加了總容量。

為什麼曼巴對於長序列的擴展能力比注意力更好?

Mamba 保持壓縮的、固定大小的狀態線性更新,避免了二次注意力成本和不斷增長的鍵值快取。

第一個 Jamba 模型支援什麼上下文視窗?

Jamba 推出時帶有 256K 令牌上下文窗口,這主要是由於其較小的 KV 快取佔用空間。

為什麼 Jamba 保留一些注意力層而不是純粹的 Mamba?

一些全注意力層保留了純狀態空間模型可能滯後的精確查找和上下文功能。