言語AIガイド

Jamba ハイブリッド トランスフォーマー - マンバ モデル

Jamba は AI21 Labs の大規模言語モデルで、Transformer のアテンション レイヤーと Mamba の状態空間レイヤー (および専門家の混合) をインターリーブして、Transformer の品質を犠牲にすることなくロングコンテキストの効率を実現します。

2分の読書最終更新日

概要

It matters because it shows hybrid architectures can beat pure Transformers on memory and throughput at long sequence lengths.

ディープダイブ

Pure Transformers は、コンテキストが増大し、キーと値のキャッシュがシーケンスの長さに応じて増大するにつれて、二次的なコストを払います。 Mamba のような純粋な状態空間モデルは線形にスケールし、固定サイズの反復状態を維持しますが、歴史的に一部のタスクでは注意が遅れます。 Jamba は両方をブレンドします。ほとんどのレイヤーが Mamba (安価で線形で、長いシーケンスに最適) であり、少数のレイヤーが標準的な注意 (正確な再現とコンテキスト内の推論に強い) であるブロックをスタックします。また、専門家混合 (MoE) レイヤーを追加して、アクティブ パラメータを控えめに保ちながら容量を拡大します。最初の Jamba は 256K トークンのコンテキスト ウィンドウを備えてリリースされ、劇的に小さい KV キャッシュのおかげで、同等の Transformers よりもはるかに多くのコンテキストを 1 つの GPU に適合させることができました。

技術的な洞察

Mamba は選択的状態空間モデルです。過去のすべてのトークンに注意するのではなく、何を保持するか忘れるかを決定する入力依存のゲートを使用して、シーケンス全体にわたって線形に更新される圧縮された反復状態を維持します。 Jamba は、多くの Mamba レイヤーの間にいくつかのフル アテンション レイヤーを散在させるため、モデルはコンピューティングとメモリの大部分が線形のままでありながら、アテンションの正確な長距離ルックアップを維持し、MoE ルーティングはトークンごとにエキスパートのサブセットのみをアクティブにします。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

Jamba ハイブリッド トランスフォーマー - Mamba モデルの将来

ハイブリッド アテンション プラス状態空間設計は、効率的なロングコンテキスト モデルの主要なレシピとして浮上しており、Jamba はこのパターンの普及に貢献しました。よりオープンで最先端のモデルが混合スタックを採用し、アテンション対 SSM の比率を洗練し、それらを MoE および KV キャッシュ トリックと組み合わせることが期待されます。コンテキストの要求が数百万のトークンに向かって増大するにつれて、状態空間レイヤーの線形メモリの利点により、ハイブリッドはオンデバイスおよびコスト重視の展開にとって特に魅力的なものになります。

現実世界の実装

同等の Transformer の KV キャッシュに収まらない、長い法的書類や大規模なコード リポジトリなどの 256K トークンの入力を単一の GPU で処理

Mamba の固定状態が会話の成長に合わせてメモリをフラットに保つ、高スループットのロングコンテキスト チャットを提供します。

コンテキストに直接詰め込まれた非常に大規模な知識ベースに対する文書分析と検索拡張生成

ハイブリッド アーキテクチャの研究のためにオープンウェイト ロングコンテキスト LLM (Jamba はオープンウェイトでリリースされました) を実行する

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jamba Hybrid Transformer-Mamba Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

状態空間モデルと Mamba

よくある質問

What is Jamba Hybrid Transformer-Mamba Models?

Jamba は AI21 Labs の大規模言語モデルで、Transformer のアテンション レイヤーと Mamba の状態空間レイヤー (および専門家の混合) をインターリーブして、Transformer の品質を犠牲にすることなくロングコンテキストの効率を実現します。これは、ハイブリッド アーキテクチャがメモリと長いシーケンス長のスループットで純粋な Transformer に勝てることが示されているため、重要です。

Jamba がインターリーブする 2 つのコア層タイプはどれですか?

Jamba の特徴的な機能は、Mamba 状態空間レイヤーと少数の Transformer アテンション レイヤーをスタックすることです。

アクティブパラメータを低く抑えながら容量を増やすために、Jamba はどのような追加テクニックを使用していますか?

Jamba は MoE レイヤーを追加するため、トークンごとにエキスパートのサブセットのみがアクティブになり、コンピューティングを比例的に増加させることなく総容量を増加させます。

Mamba はなぜ長いシーケンスに対して注意を払うよりもスケーリングが優れているのでしょうか?

Mamba は、圧縮された固定サイズの状態を線形に更新し、二次アテンション コストと増大し続けるキーと値のキャッシュを回避します。

最初の Jamba モデルはどのコンテキスト ウィンドウをサポートしていましたか?

Jamba は 256K トークンのコンテキスト ウィンドウで起動しましたが、これは主にその小さな KV キャッシュ フットプリントによって可能になりました。

Jamba が純粋な Mamba ではなく、注目層を維持しているのはなぜですか?

いくつかのフルアテンション層は、純粋な状態空間モデルが遅れる可能性がある正確なルックアップ機能とインコンテキスト機能を保持します。