Hva skjedde
NVIDIA sendte inn forhåndsvisningsytelsesdata for sin Vera Rubin NVL72-plattform til MLPerf v6.1 benchmark suite, og demonstrerte betydelige gjennomstrømningsforbedringer i forhold til forrige generasjon GB300 NVL72. Resultatene indikerer opptil 3,7 ganger høyere gjennomstrømning på Qwen3-VL-referansen og 2,5 ganger høyere gjennomstrømning på DeepSeek-R1, drevet av maskinvare-programvare co-design, NVFP4-presisjon og disaggregerte serveringsteknikker.
NVIDIA ga ut forhåndsvisningsresultater for Vera Rubin NVL72-plattformen i MLPerf v6.1-pakken, med fokus på DeepSeek-R1 og Qwen3-VL benchmarks. Selskapet rapporterte at Vera Rubin NVL72 leverer opptil 3,7 ganger høyere gjennomstrømning enn GB300 NVL72 på Qwen3-VL på tvers av offline, server og interaktive scenarier når du bruker vLLM med NVIDIA Dynamo åpen kildekode-inferensrammeverk. For DeepSeek-R1-referansen, ved bruk av NVIDIA TensorRT-LLM-biblioteket, var gjennomstrømningen opptil 2,5 ganger høyere enn GB300 NVL72.
Ytelsesgevinsten tilskrives full-stack co-design, inkludert forbedrede Tensor Cores, Transformer Engine og NVFP4-presisjon, som reduserer minnefotavtrykket for modellvekter, oppmerksomhet og KV-cache. Innsendingene brukte i stor grad disaggregert servering, separerte forhåndsutfyllings- og dekodestadier, sammen med storskala ekspertparallellisme for lag med blandinger av eksperter. NVL72-oppskaleringsdomenet, drevet av sjette generasjons NVLink og NVLink Switch, ga det sammenkoblingsgrunnlaget som er nødvendig for disse teknikkene i rack-skala.
NVIDIA fremhevet også skaleringseffektivitet, og la merke til at DeepSeek-R1-innleveringen skalert fra et enkelt GB300 NVL72-rack til fire rack (288 GPUer) med 99 % skaleringseffektivitet i frakoblet scenario. I agentarbeidsmengder, nærmere bestemt SemiAnalysis AgentX-benchmark, leverte Vera Rubin NVL72 30 ganger bedre ytelse enn GB300 NVL72 i forhåndsvisningstesting. Partner Nebius sendte også inn Vera Rubin NVL72 forhåndsvisningsresultater, som viser lignende ytelsesegenskaper.
Utgivelsen inkluderer resultater fra det bredere NVIDIA-økosystemet, med 19 partnere som sender inn data, inkludert ASUS, Azure, Cisco, CoreWeave og Oracle Cloud Infrastructure. NVIDIA sendte også inn Jetson AGX Thor-resultater ved å bruke TensorRT Edge-LLM på den nye Edge-Agentic-benchmarken med Qwen3.6-27B. Resultatene etter innsending for GPT-OSS-120B og DLRMv3 viste ytterligere gevinster, men er ennå ikke verifisert av MLCommons.
Kildedetaljer: blogs.nvidia.com ↗
Hvorfor det betyr noe
Disse resultatene gir konkrete bevis på ytelsesbanen for neste generasjons AI-inferensinfrastruktur, som direkte påvirker kostnad-per-token-økonomien for organisasjoner som implementerer store språkmodeller. Ved å demonstrere nesten-lineær skaleringseffektivitet på tvers av flere rack og betydelige gevinster i agentarbeidsbelastninger, hjelper dataene bedrifter med å forutsi infrastrukturkrav og validere den økonomiske levedyktigheten til å skalere AI-implementeringer. Dette er viktig fordi slutningskostnader er en primær driver for AI-produktets lønnsomhet og tilgjengelighet.
Den primære betydningen av disse resultatene ligger i kvantifiseringen av slutningsøkonomi. Ved å demonstrere at hvert Vera Rubin NVL72-rack kan generere betydelig flere tokens og betjene flere brukere enn et GB300 NVL72-rack, gir NVIDIA en klar beregning for kostnad-per-token-reduksjon. Dette er kritisk for organisasjoner der slutningskostnader utgjør en stor del av driftskostnadene, da det direkte oversetter til høyere inntektspotensial eller lavere servicekostnader for samme arbeidsmengde.
Vektleggingen av skaleringseffektivitet adresserer et vanlig smertepunkt i AI-infrastruktur: det ikke-lineære forholdet mellom maskinvaretillegg og gjennomstrømningsgevinster. Å oppnå 99 % skaleringseffektivitet på tvers av 288 GPUer antyder at arkitekturen og sammenkoblingene effektivt reduserer kommunikasjonsflaskehalser, slik at organisasjoner kan forutsi ytelsesgevinster mer nøyaktig når de utvider AI-fabrikkene sine.
Inkluderingen av benchmarks for agenter for arbeidsbelastning, som SemiAnalysis AgentX, signaliserer et skifte i hvordan AI-ytelse måles. Ettersom AI-systemer beveger seg fra enkeltsvingsresponser til flertrinns resonnement og handling, kan det hende at tradisjonelle gjennomstrømningsmålinger ikke fullt ut fanger nytten. 30x ytelsesforbedringen i dette spesifikke domenet indikerer at neste generasjons maskinvare er spesifikt optimalisert for ventetiden og datakravene til agent AI, som er en voksende sektor innen bedriftsapplikasjoner.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
Which component of an AI application is the machine-learning model itself?
Hva du skal se neste
Overvåk den endelige verifiseringen av disse resultatene av MLCommons og den påfølgende utgivelsen av Vera Rubin-plattformen til markedet. I tillegg kan du spore innføringen av den nye MLPerf Endpoints-benchmark for agentinferens, som vil standardisere ytelsesmålinger for multi-step AI-agenter, og observere hvordan konkurrenter reagerer på disse spesifikke gjennomstrømnings- og skaleringseffektivitetsbenchmarkene.
Den endelige verifiseringen av disse forhåndsvisningsresultatene av MLCommons er det umiddelbare neste trinnet. Inntil de er bekreftet, er disse tallene foreløpige og kan endres. Den offisielle utgivelsen vil gi den definitive ytelsesbasen for Vera Rubin-plattformen.
Markedets tilgjengelighet og prissetting av Vera Rubin NVL72-plattformen vil avgjøre den praktiske effekten. Mens ytelsesgevinstene er dokumentert, vil kostnadene for maskinvaren og overgangsperioden fra GB300 påvirke bruksratene. Organisasjoner må veie ytelsesfordelene mot kapitalutgiftene som kreves for oppgraderingen.
Utviklingen og bruken av MLPerf Endpoints benchmark for agentinferens vil være avgjørende. Etter hvert som denne referansen blir standardisert, vil den gi en mer omfattende oversikt over AI-systemfunksjoner utover rå token-gjennomstrømning, og potensielt omforme hvordan leverandører markedsfører og sammenligner plattformene deres.