返回新闻
创新AI Understanding 简报

NVIDIA Vera Rubin NVL72 发布领先的 MLPerf Inference v6.1 结果

NVIDIA 发布的预览结果显示,在 MLPerf Inference v6.1 套件中,Vera Rubin NVL72 在 Qwen3-VL 上的吞吐量比 GB300 NVL72 高出 3.7 倍,在 DeepSeek-R1 上的吞吐量高出 2.5 倍。

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
主要来源文件来源记录
出版商
blogs.nvidia.com
来源链接
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

推理
经过训练的模型生成预测或输出的运行时阶段。
大语言模型(LLM)
在海量文本语料库上训练来生成和分析文本的语言模型。
内存(代理内存)
AI 代理跨步骤或会话使用存储的上下文来提高连续性。
测试一下自己AI 模型解释测验

发生了什么

NVIDIA 向 MLPerf v6.1 基准套件提交了其 Vera Rubin NVL72 平台的预览性能数据,表明与上一代 GB300 NVL72 相比吞吐量显着提高。结果表明,在软硬件协同设计、NVFP4 精度和分解服务技术的推动下,Qwen3-VL 基准测试的吞吐量提高了 3.7 倍,DeepSeek-R1 的吞吐量提高了 2.5 倍。

NVIDIA 发布了 MLPerf v6.1 套件中 Vera Rubin NVL72 平台的预览结果,重点关注 DeepSeek-R1 和 Qwen3-VL 基准测试。该公司报告称,当 vLLM 与 NVIDIA Dynamo 开源推理框架结合使用时,Vera Rubin NVL72 在离线、服务器和交互式场景中的吞吐量比 Qwen3-VL 上的 GB300 NVL72 高出 3.7 倍。对于 DeepSeek-R1 基准测试,使用 NVIDIA TensorRT-LLM 库,吞吐量比 GB300 NVL72 高出 2.5 倍。

性能提升归功于全栈协同设计,包括增强的 Tensor Core、Transformer Engine 和 NVFP4 精度,从而减少了模型权重、注意力和 KV 缓存的内存占用。提交的内容大量使用了分类服务、分离预填充和解码阶段,以及专家混合层的大规模专家并行性。 NVL72 扩展域由第六代 NVLink 和 NVLink 交换机提供支持,为这些机架级技术提供了必要的互连基础。

NVIDIA还强调了扩展效率,指出DeepSeek-R1提交的内容从单个GB300 NVL72机架扩展到四个机架(288个GPU),在离线场景下具有99%的扩展效率。在代理工作负载中,特别是 SemiAnalysis AgentX 基准测试中,Vera Rubin NVL72 在预览测试中的性能比 GB300 NVL72 高出 30 倍。合作伙伴 Nebius 还提交了 Vera Rubin NVL72 预览结果,展示了类似的性能特征。

该发布包括更广泛的 NVIDIA 生态系统的结果,有 19 个合作伙伴提交了数据,包括华硕、Azure、思科、CoreWeave 和 Oracle 云基础设施。 NVIDIA 还在 Qwen3.6-27B 的新 Edge-Agentic 基准测试中使用 TensorRT Edge-LLM 提交了 Jetson AGX Thor 结果。 GPT-OSS-120B 和 DLRMv3 的提交后结果显示出进一步的增益,但尚未经过 MLCommons 验证。

来源详情: blogs.nvidia.com ↗

为什么这很重要

这些结果为下一代人工智能推理基础设施的性能轨迹提供了具体证据,直接影响部署大型语言模型的组织的每代币成本经济性。通过展示跨多个机架的近线性扩展效率以及代理工作负载的大幅收益,这些数据可帮助企业预测基础设施需求并验证扩展人工智能部署的经济可行性。这很重要,因为推理成本是人工智能产品盈利能力和可访问性的主要驱动因素。

这些结果的主要意义在于推理经济学的量化。通过证明每个 Vera Rubin NVL72 机架比 GB300 NVL72 机架可以生成更多的代币并为更多的用户提供服务,NVIDIA 为降低每个代币的成本提供了明确的指标。这对于推理成本构成运营支出主要部分的组织至关重要,因为它直接转化为相同工作负载的更高收入潜力或更低服务成本。

对扩展效率的强调解决了人工智能基础设施中的一个常见痛点:硬件添加和吞吐量增益之间的非线性关系。在 288 个 GPU 上实现 99% 的扩展效率表明架构和互连有效缓解了通信瓶颈,使组织能够在扩展其 AI 工厂时更准确地预测性能增益。

纳入代理工作负载基准(例如 SemiAnalysis AgentX)标志着 AI 性能衡量方式的转变。随着人工智能系统从单轮响应转向多步骤推理和行动,传统的吞吐量指标可能无法完全捕捉效用。该特定领域的性能提升了 30 倍,这表明下一代硬件专门针对代理 AI 的延迟和计算需求进行了优化,代理 AI 是企业应用中不断增长的领域。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下来看什么

关注 MLCommons 对这些结果的最终验证以及 Vera Rubin 平台随后向市场的发布。此外,跟踪新的 MLPerf Endpoints 代理推理基准的采用情况,该基准将标准化多步骤 AI 代理的性能指标,并观察竞争对手如何响应这些特定的吞吐量和扩展效率基准。

MLCommons 对这些预览结果的最终验证是下一步。在验证之前,这些数字是初步的,可能会发生变化。正式版本将为 Vera Rubin 平台提供明确的性能基准。

Vera Rubin NVL72 平台的市场可用性和定价将决定其实际影响。虽然性能提升已被记录,但硬件成本和 GB300 的过渡期将影响采用率。组织需要权衡性能优势与升级所需的资本支出。

用于代理推理的 MLPerf Endpoints 基准的开发和采用至关重要。随着该基准变得标准化,它将提供超越原始代币吞吐量的更全面的人工智能系统功能视图,有可能重塑供应商营销和比较其平台的方式。

相关指南和测验

人工智能模型解释人工智能培训AI 的未来测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?