テクニカルガイド

シーケンスの並列性とリング アテンション

シーケンス並列処理により、単一の長い入力シーケンスがトークン (時間) 次元に沿って複数の GPU に分割され、リング アテンションにより、キー/値ブロックをリング上で渡すことにより、これらの GPU が正確なアテンションを計算できるようになります。

2分の読書最終更新日

概要

Together they make million-token context windows feasible without any single GPU holding the whole sequence.

ディープダイブ

標準的なアテンションでは、すべてのキー/値を確認するためにすべてのクエリが必要となるため、アクティベーション メモリはシーケンスの長さに応じて増大し、完全な K/V が利用可能でなければなりません。シーケンスの並列処理によりシーケンスがシャード化されるため、各 GPU はトークン (およびそのクエリ、キー、値) の連続したチャンクを所有します。次に、Ring Attendance は GPU を論理リングに配置します。K/V ブロックがリング上でホップバイホップで渡される間、各デバイスはローカル クエリを固定したままにします。各ブロックが到着すると、GPU は部分的なアテンションを計算し、online-softmax (FlashAttendant と同じ実行最大/合計トリック) を使用して結果を蓄積します。完全なループの後、すべてのクエリはすべてのキーに正確に対応し、K/V 全体を保存する GPU はありません。重要なのは、K/V 通信は計算と重複するため、実時間のコストがほとんど追加されないことです。

技術的な洞察

リング アテンションはオンライン ソフトマックスに依存しています。アテンションは実行最大値と実行ノーマライザーを維持しながらブロックごとに計算され、より大きな値が現れたときに以前の部分和を再スケーリングできます。これにより、結果は数学的に完全な注意と同じになります。リングは K/V テンソルのみを渡します (サイズはシーケンス全体ではなくブロックに応じてスケールされます)。各ホップの通信は前のブロックの matmul と重複するため、メモリではなく帯域幅が制限要因になります。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

シーケンス並列処理とリング アテンションの未来

シーケンス並列処理は、ロングコンテキストのトレーニングと推論の標準になりつつあり、テンソルおよびパイプライン並列処理と組み合わせて「4D」または「5D」並列レイアウトにすることがよくあります。縞模様やジグザグの注意などのバリエーションは、因果マスキングによって引き起こされる作業のバランスを再調整します。 NVLink を介したトポロジ認識リングと、KV キャッシュ オフロードとのより緊密な統合により、取得、コードベース、および長いドキュメントの実用的なコンテキスト長が数千万のトークンに近づくことが期待されます。

現実世界の実装

リング アテンションを使用して 8 つの GPU 全体で各シーケンスをシャーディングすることにより、1M トークンのコンテキスト LLM をトレーニングする

Megatron-LM のシーケンス並列処理により、LayerNorm およびドロップアウト領域のアクティベーション メモリが削減されます

書籍全体または大規模なコード リポジトリを切り捨てずに 1 回の転送パスで処理する

リング アテンションとテンソル並列処理を組み合わせて、マルチ GPU ノードでの超ロングコンテキスト推論に適合させる

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sequence Parallelism and Ring Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

大規模モデルのテンソル並列処理

よくある質問

What is Sequence Parallelism and Ring Attention?

シーケンス並列処理により、単一の長い入力シーケンスがトークン (時間) 次元に沿って複数の GPU に分割され、リング アテンションにより、キー/値ブロックをリング上で渡すことにより、これらの GPU が正確なアテンションを計算できるようになります。これらを組み合わせることで、シーケンス全体を保持する 1 つの GPU を必要とせずに、100 万トークンのコンテキスト ウィンドウが実現可能になります。

シーケンス並列処理はどの次元に沿ってデータを分割しますか?

シーケンスの並列処理により、トークン/時間軸に沿って GPU 間で単一のシーケンスが分割されるため、各デバイスはトークンの連続したチャンクを所有します。

Ring Attendance はリング状に配置された GPU 間で何を渡しますか?

各 GPU はローカル クエリを固定したままにし、リング上でキー/値ブロックをホップバイホップで渡すため、最終的にすべてのクエリがすべてのキーを参照します。

アテンションをブロックごとに計算しながら、完全なアテンションと正確に一致させるテクニックはどれですか?

オンライン ソフトマックスは実行中の最大値と合計を追跡し、必要に応じて部分的な結果を再スケーリングし、ブロックごとの計算を完全な注意と数値的に同一にします。

リング アテンションでは、完全な K/V を保存するために単一の GPU が必要ないのはなぜですか?

K/V ブロックは段階的に到着し、各 GPU が部分的なアテンションを蓄積するため、どのデバイスもメモリ内のキー/値セット全体を一度に必要とすることはありません。

リング アテンションは通信がランタイムを支配するのをどのように防ぐのでしょうか?

各ホップの K/V 通信は現在のブロックの行列乗算とオーバーラップされるため、転送時間の大部分は計算の背後に隠れます。