InfiniBand 和 RDMA 網路
InfiniBand 是一種高速、低延遲互連,可連結 AI 叢集中的伺服器和 GPU,而 RDMA 則允許一台機器在不涉及 CPU 的情況下讀取或寫入另一台機器的記憶體。
概述
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
深入探討
當您在數千個 GPU 上訓練模型時,網路通常會成為瓶頸,而不是晶片。 InfiniBand 是專門為此構建的交換結構:它提供每秒數百吉比特的每鏈路頻寬(NDR 以 400 Gb/s 的速度運行)和微秒級的延遲。其關鍵技巧是遠端直接記憶體存取 (RDMA),它可以直接在兩個節點的記憶體之間移動數據,繞過會降低普通 TCP/IP 速度的作業系統核心和 CPU 副本。這種「核心旁路」可以釋放 CPU 週期並減少延遲。 InfiniBand 也為無損結構提供硬體流控制,NVIDIA 的 Quantum 交換器和 ConnectX 轉接器在 AI 超級電腦中佔據主導地位。 RoCE(融合乙太網路上的 RDMA)為乙太網路帶來了類似的 RDMA 優勢。
技術洞察
RDMA 透過動詞和佇列對工作。應用程式將工作請求發佈到發送和接收佇列;網路介面卡(HCA)讀取它們並將資料直接傳輸到遠端主機上預先註冊的固定記憶體區域。由於 NIC 在硬體中處理傳輸並且作業系統核心被繞過,因此批量傳輸的資料副本為零,並且沒有每個資料包的 CPU 中斷。 InfiniBand 的連結層基於信用的流量控制可防止緩衝區溢出,從而使結構無損,不會出現重傳風暴。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
InfiniBand 和 RDMA 網路的未來
頻寬不斷攀升:XDR InfiniBand 的目標是每個連結 800 Gb/s,路線圖為 1.6 Tb/s。隨著超以太網聯盟設計出與 InfiniBand 相符的人工智慧工作負載以太網,以及網內運算 (SHARP) 將集體數學卸載到交換器本身,競爭正在加劇。隨著前沿模型的發展,GPU 到網路的整合將會更加緊密,光學互連可以降低功耗,並且結構可以擴展到包含數十萬個加速器的叢集。
現實世界的實施
在人工智慧超級電腦中連接數千個 GPU,以便梯度資料在分散式訓練期間以微秒的速度在節點之間移動
讓一台伺服器直接讀取另一台伺服器的記憶體 (RDMA) 以加速分散式檔案系統和資料庫,而無需 CPU 開銷
透過 InfiniBand 運行 NCCL all-reduce 操作以跨 GPU 叢集同步模型權重
使用 RoCE 將 RDMA 式低延遲傳輸引入現有乙太網路資料中心網絡
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is InfiniBand and RDMA Networking?
InfiniBand 是一種高速、低延遲互連,可連結 AI 叢集中的伺服器和 GPU,而 RDMA 則允許一台機器在不涉及 CPU 的情況下讀取或寫入另一台機器的記憶體。它們共同構成了在大型模型訓練期間為數千個 GPU 提供資料的管道。
RDMA 從根本上允許一台電腦做什麼?
遠端直接記憶體存取在兩個節點的記憶體之間直接移動數據,繞過作業系統核心和 CPU 副本,從而減少延遲並釋放 CPU 週期。
為什麼 InfiniBand 的延遲比普通 TCP/IP 網路低很多?
InfiniBand 適配器直接將資料傳輸到硬體中的固定記憶體或從硬體中的固定記憶體傳輸數據,並繞過作業系統內核,從而消除了每個資料包的 CPU 中斷和資料複製。
NDR InfiniBand 提供的每鏈路頻寬大致是多少?
NDR(下一代資料速率)InfiniBand 以每個連結 400 Gb/s 的速度運行,而下一代 XDR 的目標是 800 Gb/s。
在 RDMA 中,「隊列對」有什麼用?
應用程式將工作請求發佈到發送和接收佇列(佇列對);主機通道適配器讀取它們並執行直接記憶體傳輸。
什麼是RoCE?
RoCE 代表融合乙太網路上的 RDMA,允許在標準乙太網路結構(而不是本機 InfiniBand)上進行低延遲、核心旁路傳輸。