NVLink 和 GPU 互连
NVLink 和相关互连是高速链路,可让许多 GPU 直接快速地相互通信。
概述
They are essential because training and serving the largest AI models requires hundreds or thousands of GPUs to act like one giant accelerator.
深入探讨
单个 GPU 无法容纳最大的模型,因此它们被分成许多芯片,这些芯片必须不断交换数据,例如权重、梯度和激活。标准 PCIe 总线对此来说速度太慢,因此 NVIDIA 创建了 NVLink,这是一种 GPU 到 GPU 的直接链接,可提供更高的带宽和更低的延迟。 NVSwitch 芯片将其扩展到一种结构中,以便服务器中的每个 GPU 都可以全速访问其他 GPU,从而将八个 GPU 变成一个大型内存和计算池。在机架规模上,像 NVIDIA 的 NVL72 这样的系统通过统一的 NVLink 域连接数十个 GPU。除了单个机架之外,InfiniBand 和以太网(通常使用 RDMA)等网络技术还将数千个节点连接到一个集群中。这些互连的质量直接限制了模型的训练规模和速度。
技术洞察
NVLink 在 GPU 之间提供专用的点对点通道,其带宽是 PCIe 的许多倍并且延迟更低,让 GPU 几乎可以像读取本地内存一样读取彼此的内存。 NVSwitch 的作用就像一个高速交叉开关,因此节点中的所有 GPU 都可以在全带宽下进行无阻塞通信。诸如 all-reduce 之类的集体操作(在训练期间对 GPU 上的梯度求和)在这种结构上运行速度要快得多,这就是为什么互连带宽强烈影响训练扩展到多个芯片的程度。
战略影响
成本与预算
多年来,架构决策决定着性能和运营成本。
更清晰的判决
技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。
质量控制
更好的工程选择可以减少生产中的可靠性事故。
NVLink 和 GPU 互连的未来
随着模型的发展超出了单一服务器的范围,互连正在成为系统。 NVLink 每一代都在不断获得带宽,并且机架级 NVLink 域(如 NVL72)正在扩大作为一个 GPU 的数量。预计会有更大的统一域、计算和网络的更紧密耦合、可降低距离功率的光链路,以及业界在开放互连标准(例如 UALink)方面所做的努力,以与专有结构相竞争。扩展人工智能越来越依赖于芯片之间的数据传输以及芯片本身。
现实世界的实施
通过 NVSwitch 连接一台服务器(如 NVIDIA DGX 系统)内的八个 GPU,以便它们共享内存并一起训练一个大型模型。
在分布式训练期间跨 GPU 执行 all-reduce 梯度同步,并由 NVLink 带宽加速。
将机架级 NVL72 系统中的数十个 GPU 连接到一个统一的 NVLink 域,以实现万亿参数模型。
使用 InfiniBand 或 RDMA-over-Ethernet 将数千台 GPU 服务器连接到集群中,以进行大规模基础模型训练。
风险与防护栏
优化一项基准测试可以隐藏更广泛的系统弱点。
基础设施和维护成本常常被低估。
随着系统变得更加复杂,安全性和可观察性差距可能会扩大。
实施路线图
在实施之前定义延迟、质量和成本目标。
在实际负载和数据条件下进行基准测试。
仪器监控错误、漂移和用户影响。
在扩展之前准备回滚和事件响应路径。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the NVLink and GPU Interconnects quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is NVLink and GPU Interconnects?
NVLink 和相关互连是高速链路,可让许多 GPU 直接快速地相互通信。它们至关重要,因为训练和服务最大的 AI 模型需要数百或数千个 GPU 才能像一个巨大的加速器一样运行。
为什么大型 AI 模型需要像 NVLink 这样的高速互连?
大型模型超出了单个 GPU 的容量,因此它们分布在许多芯片上,这些芯片不断共享权重、梯度和激活,需要快速链接。
与标准 PCIe 总线相比,NVLink 在 GPU 间通信方面具有哪些优势?
NVLink 是 GPU 到 GPU 的直接链接,具有比 PCIe 大得多的带宽和更低的延迟,可实现芯片之间的快速数据交换。
NVSwitch 在多 GPU 服务器中的作用是什么?
NVSwitch 将 NVLink 扩展为非阻塞结构,让节点中的所有 GPU 彼此全速通信。
分布式训练中常见的哪种集体操作可以从快速互连中受益匪浅?
每个训练步骤都进行 All-reduce 总和并在所有 GPU 上共享梯度,因此其速度在很大程度上取决于互连带宽。
除了一台服务器之外,通常还有哪些技术将数千个 GPU 节点连接到一个集群中?
在集群规模上,InfiniBand 或带有 RDMA 的以太网等网络将许多节点连接在一起,补充了每个服务器内的 NVLink。