Tilbake til Nyheter
InnovasjonAI Understanding orientering

NVIDIA Vera Rubin NVL72 legger inn ledende MLPerf Inference v6.1-resultater

NVIDIA lanserte forhåndsvisningsresultater som viser at Vera Rubin NVL72 oppnår opptil 3,7 ganger høyere gjennomstrømning enn GB300 NVL72 på Qwen3-VL og 2,5x på DeepSeek-R1 i MLPerf Inference v6.1-pakken.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
PrimærkildedokumentKilde registrert
Utgiver
blogs.nvidia.com
Kilde lenke
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Inferens
Kjøretidsfasen der en trent modell genererer spådommer eller utdata.
Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Minne (agentminne)
Lagret kontekst en AI-agent bruker på tvers av trinn eller økter for å forbedre kontinuiteten.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

NVIDIA sendte inn forhåndsvisningsytelsesdata for sin Vera Rubin NVL72-plattform til MLPerf v6.1 benchmark suite, og demonstrerte betydelige gjennomstrømningsforbedringer i forhold til forrige generasjon GB300 NVL72. Resultatene indikerer opptil 3,7 ganger høyere gjennomstrømning på Qwen3-VL-referansen og 2,5 ganger høyere gjennomstrømning på DeepSeek-R1, drevet av maskinvare-programvare co-design, NVFP4-presisjon og disaggregerte serveringsteknikker.

NVIDIA ga ut forhåndsvisningsresultater for Vera Rubin NVL72-plattformen i MLPerf v6.1-pakken, med fokus på DeepSeek-R1 og Qwen3-VL benchmarks. Selskapet rapporterte at Vera Rubin NVL72 leverer opptil 3,7 ganger høyere gjennomstrømning enn GB300 NVL72 på Qwen3-VL på tvers av offline, server og interaktive scenarier når du bruker vLLM med NVIDIA Dynamo åpen kildekode-inferensrammeverk. For DeepSeek-R1-referansen, ved bruk av NVIDIA TensorRT-LLM-biblioteket, var gjennomstrømningen opptil 2,5 ganger høyere enn GB300 NVL72.

Ytelsesgevinsten tilskrives full-stack co-design, inkludert forbedrede Tensor Cores, Transformer Engine og NVFP4-presisjon, som reduserer minnefotavtrykket for modellvekter, oppmerksomhet og KV-cache. Innsendingene brukte i stor grad disaggregert servering, separerte forhåndsutfyllings- og dekodestadier, sammen med storskala ekspertparallellisme for lag med blandinger av eksperter. NVL72-oppskaleringsdomenet, drevet av sjette generasjons NVLink og NVLink Switch, ga det sammenkoblingsgrunnlaget som er nødvendig for disse teknikkene i rack-skala.

NVIDIA fremhevet også skaleringseffektivitet, og la merke til at DeepSeek-R1-innleveringen skalert fra et enkelt GB300 NVL72-rack til fire rack (288 GPUer) med 99 % skaleringseffektivitet i frakoblet scenario. I agentarbeidsmengder, nærmere bestemt SemiAnalysis AgentX-benchmark, leverte Vera Rubin NVL72 30 ganger bedre ytelse enn GB300 NVL72 i forhåndsvisningstesting. Partner Nebius sendte også inn Vera Rubin NVL72 forhåndsvisningsresultater, som viser lignende ytelsesegenskaper.

Utgivelsen inkluderer resultater fra det bredere NVIDIA-økosystemet, med 19 partnere som sender inn data, inkludert ASUS, Azure, Cisco, CoreWeave og Oracle Cloud Infrastructure. NVIDIA sendte også inn Jetson AGX Thor-resultater ved å bruke TensorRT Edge-LLM på den nye Edge-Agentic-benchmarken med Qwen3.6-27B. Resultatene etter innsending for GPT-OSS-120B og DLRMv3 viste ytterligere gevinster, men er ennå ikke verifisert av MLCommons.

Kildedetaljer: blogs.nvidia.com ↗

Hvorfor det betyr noe

Disse resultatene gir konkrete bevis på ytelsesbanen for neste generasjons AI-inferensinfrastruktur, som direkte påvirker kostnad-per-token-økonomien for organisasjoner som implementerer store språkmodeller. Ved å demonstrere nesten-lineær skaleringseffektivitet på tvers av flere rack og betydelige gevinster i agentarbeidsbelastninger, hjelper dataene bedrifter med å forutsi infrastrukturkrav og validere den økonomiske levedyktigheten til å skalere AI-implementeringer. Dette er viktig fordi slutningskostnader er en primær driver for AI-produktets lønnsomhet og tilgjengelighet.

Den primære betydningen av disse resultatene ligger i kvantifiseringen av slutningsøkonomi. Ved å demonstrere at hvert Vera Rubin NVL72-rack kan generere betydelig flere tokens og betjene flere brukere enn et GB300 NVL72-rack, gir NVIDIA en klar beregning for kostnad-per-token-reduksjon. Dette er kritisk for organisasjoner der slutningskostnader utgjør en stor del av driftskostnadene, da det direkte oversetter til høyere inntektspotensial eller lavere servicekostnader for samme arbeidsmengde.

Vektleggingen av skaleringseffektivitet adresserer et vanlig smertepunkt i AI-infrastruktur: det ikke-lineære forholdet mellom maskinvaretillegg og gjennomstrømningsgevinster. Å oppnå 99 % skaleringseffektivitet på tvers av 288 GPUer antyder at arkitekturen og sammenkoblingene effektivt reduserer kommunikasjonsflaskehalser, slik at organisasjoner kan forutsi ytelsesgevinster mer nøyaktig når de utvider AI-fabrikkene sine.

Inkluderingen av benchmarks for agenter for arbeidsbelastning, som SemiAnalysis AgentX, signaliserer et skifte i hvordan AI-ytelse måles. Ettersom AI-systemer beveger seg fra enkeltsvingsresponser til flertrinns resonnement og handling, kan det hende at tradisjonelle gjennomstrømningsmålinger ikke fullt ut fanger nytten. 30x ytelsesforbedringen i dette spesifikke domenet indikerer at neste generasjons maskinvare er spesifikt optimalisert for ventetiden og datakravene til agent AI, som er en voksende sektor innen bedriftsapplikasjoner.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Overvåk den endelige verifiseringen av disse resultatene av MLCommons og den påfølgende utgivelsen av Vera Rubin-plattformen til markedet. I tillegg kan du spore innføringen av den nye MLPerf Endpoints-benchmark for agentinferens, som vil standardisere ytelsesmålinger for multi-step AI-agenter, og observere hvordan konkurrenter reagerer på disse spesifikke gjennomstrømnings- og skaleringseffektivitetsbenchmarkene.

Den endelige verifiseringen av disse forhåndsvisningsresultatene av MLCommons er det umiddelbare neste trinnet. Inntil de er bekreftet, er disse tallene foreløpige og kan endres. Den offisielle utgivelsen vil gi den definitive ytelsesbasen for Vera Rubin-plattformen.

Markedets tilgjengelighet og prissetting av Vera Rubin NVL72-plattformen vil avgjøre den praktiske effekten. Mens ytelsesgevinstene er dokumentert, vil kostnadene for maskinvaren og overgangsperioden fra GB300 påvirke bruksratene. Organisasjoner må veie ytelsesfordelene mot kapitalutgiftene som kreves for oppgraderingen.

Utviklingen og bruken av MLPerf Endpoints benchmark for agentinferens vil være avgjørende. Etter hvert som denne referansen blir standardisert, vil den gi en mer omfattende oversikt over AI-systemfunksjoner utover rå token-gjennomstrømning, og potensielt omforme hvordan leverandører markedsfører og sammenligner plattformene deres.

Relaterte guider og quizer

AI-modeller forklartAI treningKIs fremtidTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?