Vad hände
NVIDIA skickade in förhandsgranskningsprestandadata för sin Vera Rubin NVL72-plattform till MLPerf v6.1 benchmark-sviten, vilket visar betydande förbättringar av genomströmningen jämfört med föregående generation GB300 NVL72. Resultaten indikerar upp till 3,7 gånger högre genomströmning på Qwen3-VL benchmark och 2,5 gånger högre genomströmning på DeepSeek-R1, driven av samdesign av hårdvara och mjukvara, NVFP4-precision och disaggregerad serveringsteknik.
NVIDIA släppte förhandsgranskningsresultat för Vera Rubin NVL72-plattformen i MLPerf v6.1-sviten, med fokus på DeepSeek-R1 och Qwen3-VL benchmarks. Företaget rapporterade att Vera Rubin NVL72 levererar upp till 3,7 gånger högre genomströmning än GB300 NVL72 på Qwen3-VL över offline-, server- och interaktiva scenarier när man använder vLLM med NVIDIA Dynamo open-source inferensramverk. För DeepSeek-R1 benchmark, med NVIDIA TensorRT-LLM-biblioteket, var genomströmningen upp till 2,5 gånger högre än GB300 NVL72.
Prestandavinsterna tillskrivs full-stack co-design, inklusive förbättrade Tensor Cores, Transformer Engine och NVFP4-precision, vilket minskar minnesfotavtrycket för modellvikter, uppmärksamhet och KV-cache. Inlämningarna använde kraftigt uppdelad servering, separerade förfyllnings- och avkodningsstadier, tillsammans med storskalig expertparallellism för blandning av expertskikt. NVL72-uppskalningsdomänen, som drivs av sjätte generationens NVLink och NVLink Switch, gav den sammankopplingsgrund som var nödvändig för dessa tekniker i rackskala.
NVIDIA lyfte också fram skalningseffektivitet och noterade att DeepSeek-R1-inlämningen skalades från ett enda GB300 NVL72-rack till fyra rack (288 GPU: er) med 99 % skalningseffektivitet i offline-scenariot. I agentarbetsbelastningar, närmare bestämt SemiAnalysis AgentX benchmark, levererade Vera Rubin NVL72 30 gånger bättre prestanda än GB300 NVL72 i förhandsgranskningstestning. Partner Nebius skickade också in Vera Rubin NVL72 förhandsgranskningsresultat, som visar liknande prestandaegenskaper.
Releasen inkluderar resultat från det bredare NVIDIA-ekosystemet, med 19 partners som skickar in data, inklusive ASUS, Azure, Cisco, CoreWeave och Oracle Cloud Infrastructure. NVIDIA skickade också in Jetson AGX Thor-resultat med TensorRT Edge-LLM på det nya Edge-Agentic benchmark med Qwen3.6-27B. Resultat efter inlämning för GPT-OSS-120B och DLRMv3 visade ytterligare vinster men är ännu inte verifierade av MLCommons.
Källinformation: blogs.nvidia.com ↗
Varför det spelar roll
Dessa resultat ger konkreta bevis på prestandabanan för nästa generations AI-inferensinfrastruktur, vilket direkt påverkar kostnaden per token-ekonomi för organisationer som använder stora språkmodeller. Genom att demonstrera nästan linjär skalningseffektivitet över flera rack och avsevärda vinster i agentarbetsbelastningar, hjälper data företag att förutsäga infrastrukturkrav och validera den ekonomiska bärkraften av att skala AI-distributioner. Detta är viktigt eftersom slutledningskostnader är en primär drivkraft för AI-produktens lönsamhet och tillgänglighet.
Den primära betydelsen av dessa resultat ligger i kvantifieringen av slutledningsekonomi. Genom att visa att varje Vera Rubin NVL72-rack kan generera betydligt fler tokens och tjäna fler användare än ett GB300 NVL72-rack, ger NVIDIA ett tydligt mått för kostnad-per-token-reduktion. Detta är avgörande för organisationer där slutledningskostnader utgör en stor del av driftskostnaderna, eftersom det direkt översätts till högre intäktspotential eller lägre servicekostnader för samma arbetsbelastning.
Betoningen på skalningseffektivitet adresserar en vanlig smärtpunkt i AI-infrastruktur: det icke-linjära förhållandet mellan hårdvarutillägg och genomströmningsvinster. Att uppnå 99 % skalningseffektivitet över 288 GPU:er tyder på att arkitekturen och sammankopplingarna effektivt mildrar kommunikationsflaskhalsar, vilket gör att organisationer kan förutsäga prestandavinster mer exakt när de utökar sina AI-fabriker.
Inkluderandet av riktmärken för agenter för arbetsbelastning, såsom SemiAnalysis AgentX, signalerar en förändring i hur AI-prestanda mäts. När AI-system går från envarvssvar till flerstegsresonemang och handling, kanske traditionella genomströmningsstatistik inte helt fångar nyttan. 30x prestandaförbättringen i denna specifika domän indikerar att nästa generations hårdvara är specifikt optimerad för latens- och beräkningskraven från agent AI, som är en växande sektor inom företagsapplikationer.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
Which component of an AI application is the machine-learning model itself?
Vad du ska titta på härnäst
Övervaka den slutliga verifieringen av dessa resultat av MLCommons och den efterföljande lanseringen av Vera Rubin-plattformen på marknaden. Spåra dessutom antagandet av det nya MLPerf Endpoints-riktmärket för agentinferens, som kommer att standardisera prestandamått för multi-stegs AI-agenter, och observera hur konkurrenter reagerar på dessa specifika riktmärken för genomströmning och skalningseffektivitet.
Den slutliga verifieringen av dessa förhandsgranskningsresultat av MLCommons är det omedelbara nästa steget. Tills de har verifierats är dessa siffror preliminära och kan komma att ändras. Den officiella releasen kommer att ge den definitiva prestandabaslinjen för Vera Rubin-plattformen.
Marknadens tillgänglighet och prissättning av Vera Rubin NVL72-plattformen kommer att avgöra dess praktiska inverkan. Medan prestandavinsterna är dokumenterade, kommer kostnaden för hårdvaran och övergångsperioden från GB300 att påverka användningshastigheten. Organisationer kommer att behöva väga resultatfördelarna mot de kapitalutgifter som krävs för uppgraderingen.
Utvecklingen och antagandet av MLPerf Endpoints benchmark för agentiska slutsatser kommer att vara avgörande. När detta riktmärke blir standardiserat kommer det att ge en mer heltäckande bild av AI-systemets kapacitet bortom rå token-genomströmning, vilket potentiellt kan omforma hur leverantörer marknadsför och jämför sina plattformar.