高带宽内存
高带宽内存 (HBM) 是放置在 GPU 旁边的堆叠内存,其传输数据的速度比普通 RAM 快得多。
概述
It is what keeps AI accelerators fed, preventing the powerful compute cores from sitting idle while they wait for model weights and data.
深入探讨
HBM 解决了一个基本瓶颈:现代人工智能芯片每秒可以执行数万亿次操作,但前提是数据到达得足够快。标准 GDDR 内存通过相对较窄的总线进行连接,而 HBM 垂直堆叠多个 DRAM 芯片,并通过数千条称为硅通孔 (TSV) 的微小垂直导线将它们连接起来。这些堆栈位于距离 GPU 几毫米的硅中介层上,提供了极宽的数据路径,可以同时处理数千位而不是数百位。结果是以每秒 TB 为单位测量的带宽。从 HBM2 发展到 HBM2e、HBM3 和 HBM3e,每一代都提高了容量和速度。对于权重必须不断传输的大型语言模型,HBM 容量和带宽通常比原始计算更重要。
技术洞察
HBM 通过极端并行性而不是更高的时钟速率来实现其速度。通过堆叠 DRAM 芯片并将它们与数千个 TSV 连接起来,它公开了一个非常宽的接口(每个堆栈 1024 位及以上),因此可以同时移动如此多的字节。将堆栈放置在 GPU 旁边的共享中介层上可以缩短接线,从而降低每位功耗和延迟。 NVIDIA H100 或 H200 等单一加速器可与多个 HBM 堆栈配对,以达到每秒数 TB 的总内存带宽。
战略影响
成本与预算
多年来,架构决策决定着性能和运营成本。
更清晰的判决
技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。
质量控制
更好的工程选择可以减少生产中的可靠性事故。
高带宽内存的未来
内存带宽现在是 AI 的主要限制,因此 HBM 正在快速发展。 HBM3e 正在旗舰加速器中出货,HBM4 即将推出,承诺更宽的接口、更高的堆栈以及每个封装的更大容量。预计存储器和逻辑之间将进行更紧密的协同设计,可能是定制芯片和近存储器处理,以及 SK 海力士、三星和美光等供应商之间的激烈竞争。随着模型的增长,让更多的数据更接近计算、更快、更低的能耗,仍然是人工智能硬件进步的核心。
现实世界的实施
将大型语言模型的数十或数百 GB 的权重保存在靠近 GPU 的位置,以便可以在每个推理步骤中对它们进行流式传输。
使 NVIDIA H100 和 H200 数据中心 GPU 能够达到每秒数 TB 的内存带宽进行训练。
为 AI 训练集群提供支持,其中许多 GPU 都依赖 HBM 来避免矩阵运算之间的停滞。
支持必须将巨大的激活张量快速移入和移出内存的高分辨率生成图像和视频模型。
风险与防护栏
优化一项基准测试可以隐藏更广泛的系统弱点。
基础设施和维护成本常常被低估。
随着系统变得更加复杂,安全性和可观察性差距可能会扩大。
实施路线图
在实施之前定义延迟、质量和成本目标。
在实际负载和数据条件下进行基准测试。
仪器监控错误、漂移和用户影响。
在扩展之前准备回滚和事件响应路径。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the High Bandwidth Memory quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is High Bandwidth Memory?
高带宽内存 (HBM) 是放置在 GPU 旁边的堆叠内存,其传输数据的速度比普通 RAM 快得多。它是保持人工智能加速器运行的原因,防止强大的计算核心在等待模型权重和数据时闲置。
高带宽内存为 AI 加速器解决的主要问题是什么?
仅当数据到达足够快时,人工智能芯片才能每秒执行数万亿次操作; HBM 提供该带宽,因此内核不会匮乏。
HBM 的物理构造与普通 GDDR 内存有何不同?
HBM 将 DRAM 芯片堆叠在一起,并通过数千条垂直线 (TSV) 将它们连接起来,从而创建非常宽的数据路径。
HBM主要依靠什么来实现其高带宽?
HBM 并没有提供更快的时钟速度,而是公开了一个非常宽的接口(每个堆栈 1024 位及以上),因此可以同时移动许多字节。
为什么 HBM 堆栈放置在 GPU 旁边的硅中介层上?
共享中介层上的短线降低了每比特传输所需的能量,并减少了内存和计算之间的延迟。
特别是对于大型语言模型,为什么 HBM 与原始计算一样重要?
LLM 推理持续传输大型权重矩阵,因此内存容量和带宽通常成为限制因素,而不是计算吞吐量。