マルチヘッドの潜在的注意力
マルチヘッド潜在アテンション (MLA) は、DeepSeek-V2 で導入されたアテンション メカニズムで、メモリを大量に消費するキーと値のキャッシュを小さな共有潜在ベクトルに圧縮します。
概要
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
ディープダイブ
トランスフォーマーはテキストを生成するときに、過去のすべてのトークンのキーと値のベクトルを「KV キャッシュ」に保存します。このキャッシュはコンテキストの長さに応じて増大し、推論中のメモリ使用を支配します。 MLA は、多くのフルサイズのキー/値ベクトルをトークンごとに 1 つの低ランクの潜在ベクトルに置き換え、その潜在ベクトルをその場でヘッドごとのキーと値に戻します。コンパクト レイテントのみがキャッシュされるため、DeepSeek-V2 は、標準のマルチヘッド アテンションと比較して KV キャッシュ メモリを 90% 以上削減し、より長いコンテキストとより大きなバッチ サイズを可能にすることを報告しました。重要なのは、アップ投影行列を他の重みに折り畳むことができるため、MLA はモデリングの品質をほとんどまたはまったく損失せずにこの圧縮を達成します。
技術的な洞察
MLA は低ランクの結合圧縮を実行します。つまり、各トークンの隠れ状態が小さな潜在ベクトルに下方投影され、個別の上投影行列がヘッドごとのキーと値を再構築します。賢いトリックは、上向き投影の重みをクエリと出力投影に「吸収」することで、モデルが推論中に完全なキー/値を具体化しないようにすることです。回転位置の埋め込みは、位置情報を維持しながら同じ方法で回転を吸収できないため、分離されたキー パスで処理されます。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
多頭潜在的注意力の未来
MLA は、DeepSeek-V2 と V3 を経済的に大規模に提供できるようにするのに役立ち、チームが低コストのロングコンテキスト推論を追求するにつれてこの技術が普及しています。将来のオープン モデルでは、MLA スタイルの潜在圧縮が、スパースな専門家混合レイヤー、量子化キャッシュ、および投機的デコードと組み合わされることが期待されます。研究者らはまた、品質が低下する前に潜在的な次元がどこまで縮小できるか、同じ低ランクのアイデアが推論だけでなくトレーニング中に注意を圧縮できるかどうかも調査しています。
現実世界の実装
リクエストあたりの GPU メモリ使用量が大幅に削減された DeepSeek-V2/V3 チャット モデルを提供
大規模な KV キャッシュが VRAM を使い果たす可能性がある場所で、長い文書の質問回答を実行する
各シーケンスには小さな潜在ベクトルしか保存されないため、固定 GPU での推論バッチ サイズが増加します。
検索拡張アシスタント用の汎用ハードウェアでより長いコンテキスト ウィンドウを有効にする
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
マルチクエリアテンション
よくある質問
What is Multi-Head Latent Attention?
マルチヘッド潜在アテンション (MLA) は、DeepSeek-V2 で導入されたアテンション メカニズムで、メモリを大量に消費するキーと値のキャッシュを小さな共有潜在ベクトルに圧縮します。これにより、標準的な注意に近い品質を維持しながら、はるかに少ない GPU メモリで大規模な言語モデルを実行できるようになります。
マルチヘッド潜在的注意が軽減するように設計されている主な問題は何ですか?
MLA は KV キャッシュを対象とします。KV キャッシュはコンテキストの長さに応じて増大し、テキスト生成中にメモリを支配します。
MLA はどのようにして KV キャッシュを縮小しますか?
MLA は、トークンごとに 1 つのコンパクトな潜在ベクトルをキャッシュし、アッププロジェクションを通じてそこからキーと値を再構築します。
マルチヘッド潜在注意力を最初に導入したモデルはどれですか?
MLA は、DeepSeek によって DeepSeek-V2 モデルで導入され、DeepSeek-V3 に引き継がれました。
MLA では、回転位置の埋め込みに別の「分離された」パスが必要なのはなぜですか?
回転変換は他の重み行列に吸収できないため、MLA は位置情報を伝えるために小さな分離されたキー コンポーネントを保持します。
DeepSeek-V2 は、標準的なマルチヘッド アテンションと比較して、MLA からどの程度の KV キャッシュ メモリ削減を報告しましたか?
DeepSeek-V2 は、KV キャッシュ メモリを 90% 以上削減し、より長いコンテキストとより大きなバッチを可能にすることを報告しました。