InfiniBand および RDMA ネットワーキング
InfiniBand は、AI クラスター内のサーバーと GPU をリンクする高速かつ低遅延の相互接続であり、RDMA を使用すると、CPU を介さずに、あるマシンが別のマシンのメモリを読み書きできるようになります。
概要
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
ディープダイブ
数千の GPU にわたってモデルをトレーニングする場合、多くの場合、チップではなくネットワークがボトルネックになります。 InfiniBand は、この目的のために構築されたスイッチド ファブリックです。数百ギガビット/秒のリンクごとの帯域幅 (NDR は 400 Gb/s で動作) とマイクロ秒スケールの遅延を提供します。その重要なトリックは、リモート ダイレクト メモリ アクセス (RDMA) です。これは、通常の TCP/IP の速度を低下させるオペレーティング システムのカーネルと CPU のコピーをバイパスして、2 つのノードのメモリ間でデータを直接移動します。この「カーネル バイパス」により CPU サイクルが解放され、レイテンシが短縮されます。 InfiniBand はロスレス ファブリックのハードウェア フロー制御も提供し、NVIDIA の Quantum スイッチと ConnectX アダプターが AI スーパーコンピューターを支配します。 RoCE (RDMA over Converged Ethernet) は、イーサネット ネットワークに同様の RDMA 利点をもたらします。
技術的な洞察
RDMA は動詞とキュー ペアを通じて機能します。アプリケーションは、キューを送信および受信するために作業リクエストをポストします。ネットワーク アダプタ (HCA) はそれらを読み取り、リモート ホスト上の事前に登録され固定されたメモリ領域にデータを直接転送します。 NIC がハードウェアで転送を処理し、OS カーネルがバイパスされるため、バルク転送ではデータ コピーが発生せず、パケットごとの CPU 割り込みも発生しません。 InfiniBand のリンク層のクレジット ベースのフロー制御はバッファ オーバーフローを防止し、再送信ストームのないファブリックのロスレス化を実現します。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
InfiniBand と RDMA ネットワーキングの将来
帯域幅は増加し続けています。XDR InfiniBand はリンクあたり 800 Gb/s を目標としており、1.6 Tb/s に向けたロードマップがあります。 Ultra Ethernet Consortium が AI ワークロード向けに InfiniBand に適合する Ethernet を設計し、ネットワーク内コンピューティング (SHARP) が集合的な演算をスイッチ自体にオフロードするにつれて、競争は激化しています。最先端モデルの成長に伴い、より緊密な GPU とネットワークの統合、電力を削減するための光インターコネクト、数十万のアクセラレータのクラスターにスケールされるファブリックが期待されます。
現実世界の実装
AI スーパーコンピューターで数千の GPU を接続し、分散トレーニング中に勾配データがマイクロ秒単位でノード間を移動できるようにする
あるサーバーが別のサーバーのメモリを直接読み取る (RDMA) ことで、CPU オーバーヘッドを発生させずに分散ファイル システムとデータベースを高速化します。
InfiniBand を介して NCCL all-reduce 操作を実行して、GPU クラスター全体でモデルの重みを同期する
RoCE を使用して、RDMA スタイルの低遅延転送を既存のイーサネット データセンター ネットワークに実現
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
特徴エンジニアリング パイプラインとデータのバージョニング
よくある質問
What is InfiniBand and RDMA Networking?
InfiniBand は、AI クラスター内のサーバーと GPU をリンクする高速かつ低遅延の相互接続であり、RDMA を使用すると、CPU を介さずに、あるマシンが別のマシンのメモリを読み書きできるようになります。これらは共に、大規模モデルのトレーニング中に数千の GPU にデータを供給し続ける配管となります。
RDMA では基本的に 1 台のコンピュータに何ができるのでしょうか?
リモート ダイレクト メモリ アクセスは、OS カーネルと CPU コピーをバイパスして 2 つのノードのメモリ間でデータを直接移動するため、レイテンシが短縮され、CPU サイクルが解放されます。
InfiniBand が通常の TCP/IP ネットワーキングよりもはるかに低い遅延を達成できるのはなぜですか?
InfiniBand アダプタは、ハードウェアの固定メモリとの間でデータを直接転送し、OS カーネルをバイパスして、パケットごとの CPU 割り込みとデータ コピーを排除します。
NDR InfiniBand が提供するリンクごとの帯域幅はおおよそどれくらいですか?
NDR (Next Data Rate) InfiniBand はリンクあたり 400 Gb/s で動作し、XDR は次世代で 800 Gb/s を目標としています。
RDMA では、「キュー ペア」は何に使用されますか?
アプリケーションはキュー (キュー ペア) を送信および受信するための作業リクエストをポストします。ホスト チャネル アダプタはそれらを読み取り、ダイレクト メモリ転送を実行します。
RoCEとは何ですか?
RoCE は RDMA over Converged Ethernet の略で、ネイティブ InfiniBand ではなく標準の Ethernet ファブリック上で低遅延のカーネル バイパス転送を可能にします。