技术指南

InfiniBand 和 RDMA 网络

InfiniBand 是一种高速、低延迟互连,可链接 AI 集群中的服务器和 GPU,而 RDMA 则允许一台机器在不涉及 CPU 的情况下读取或写入另一台机器的内存。

阅读时间:2分钟最后更新

概述

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

深入探讨

当您在数千个 GPU 上训练模型时,网络通常会成为瓶颈,而不是芯片。 InfiniBand 是专门为此构建的交换结构:它提供每秒数百吉比特的每链路带宽(NDR 以 400 Gb/s 的速度运行)和微秒级的延迟。其关键技巧是远程直接内存访问 (RDMA),它可以直接在两个节点的内存之间移动数据,绕过会降低普通 TCP/IP 速度的操作系统内核和 CPU 副本。这种“内核旁路”可以释放 CPU 周期并减少延迟。 InfiniBand 还为无损结构提供硬件流控制,NVIDIA 的 Quantum 交换机和 ConnectX 适配器在 AI 超级计算机中占据主导地位。 RoCE(融合以太网上的 RDMA)为以太网网络带来了类似的 RDMA 优势。

技术洞察

RDMA 通过动词和队列对工作。应用程序将工作请求发布到发送和接收队列;网络适​​配器(HCA)读取它们并将数据直接传输到远程主机上预先注册的固定内存区域。由于 NIC 在硬件中处理传输并且操作系统内核被绕过,因此批量传输的数据副本为零,并且没有每数据包的 CPU 中断。 InfiniBand 的链路层基于信用的流量控制可防止缓冲区溢出,从而使结构无损,不会出现重传风暴。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

InfiniBand 和 RDMA 网络的未来

带宽不断攀升:XDR InfiniBand 的目标是每个链路 800 Gb/s,路线图为 1.6 Tb/s。随着超以太网联盟设计出与 InfiniBand 相匹配的人工智能工作负载以太网,以及网内计算 (SHARP) 将集体数学卸载到交换机本身,竞争正在加剧。随着前沿模型的发展,GPU 到网络的集成将会更加紧密,光学互连可以降低功耗,并且结构可以扩展到包含数十万个加速器的集群。

现实世界的实施

在人工智能超级计算机中连接数千个 GPU,以便梯度数据在分布式训练期间以微秒的速度在节点之间移动

让一台服务器直接读取另一台服务器的内存 (RDMA) 以加速分布式文件系统和数据库,而无需 CPU 开销

通过 InfiniBand 运行 NCCL all-reduce 操作以跨 GPU 集群同步模型权重

使用 RoCE 将 RDMA 式低延迟传输引入现有以太网数据中心网络

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

特征工程管道和数据版本控制

常见问题

What is InfiniBand and RDMA Networking?

InfiniBand 是一种高速、低延迟互连,可链接 AI 集群中的服务器和 GPU,而 RDMA 则允许一台机器在不涉及 CPU 的情况下读取或写入另一台机器的内存。它们共同构成了在大型模型训练期间为数千个 GPU 提供数据的管道。

RDMA 从根本上允许一台计算机做什么?

远程直接内存访问在两个节点的内存之间直接移动数据,绕过操作系统内核和 CPU 副本,从而减少延迟并释放 CPU 周期。

为什么 InfiniBand 的延迟比普通 TCP/IP 网络低得多?

InfiniBand 适配器直接将数据传输到硬件中的固定内存或从硬件中的固定内存传输数据,并绕过操作系统内核,从而消除了每个数据包的 CPU 中断和数据复制。

NDR InfiniBand 提供的每链路带宽大致是多少?

NDR(下一代数据速率)InfiniBand 以每个链路 400 Gb/s 的速度运行,而下一代 XDR 的目标是 800 Gb/s。

在 RDMA 中,“队列对”有什么用?

应用程序将工作请求发布到发送和接收队列(队列对);主机通道适配器读取它们并执行直接内存传输。

什么是RoCE?

RoCE 代表融合以太网上的 RDMA,允许在标准以太网结构(而不​​是本机 InfiniBand)上进行低延迟、内核旁路传输。