Tillbaka till Nyheter
InnovationAI Understanding genomgång

NVIDIA Vera Rubin NVL72 publicerar ledande MLPerf Inference v6.1-resultat

NVIDIA släppte förhandsgranskningsresultat som visar att Vera Rubin NVL72 uppnår upp till 3,7 gånger högre genomströmning än GB300 NVL72 på Qwen3-VL och 2,5x på DeepSeek-R1 i MLPerf Inference v6.1-sviten.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
Primärt källdokumentKälla inspelad
Förläggare
blogs.nvidia.com
Källlänk
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Slutledning
Körtidsfasen där en tränad modell genererar förutsägelser eller utdata.
Stor språkmodell (LLM)
En språkmodell tränad på massiva textkorpus för att generera och analysera text.
Minne (agentminne)
Lagrat sammanhang som en AI-agent använder över steg eller sessioner för att förbättra kontinuiteten.
Testa dig självAI Models Explained Quiz

Vad hände

NVIDIA skickade in förhandsgranskningsprestandadata för sin Vera Rubin NVL72-plattform till MLPerf v6.1 benchmark-sviten, vilket visar betydande förbättringar av genomströmningen jämfört med föregående generation GB300 NVL72. Resultaten indikerar upp till 3,7 gånger högre genomströmning på Qwen3-VL benchmark och 2,5 gånger högre genomströmning på DeepSeek-R1, driven av samdesign av hårdvara och mjukvara, NVFP4-precision och disaggregerad serveringsteknik.

NVIDIA släppte förhandsgranskningsresultat för Vera Rubin NVL72-plattformen i MLPerf v6.1-sviten, med fokus på DeepSeek-R1 och Qwen3-VL benchmarks. Företaget rapporterade att Vera Rubin NVL72 levererar upp till 3,7 gånger högre genomströmning än GB300 NVL72 på Qwen3-VL över offline-, server- och interaktiva scenarier när man använder vLLM med NVIDIA Dynamo open-source inferensramverk. För DeepSeek-R1 benchmark, med NVIDIA TensorRT-LLM-biblioteket, var genomströmningen upp till 2,5 gånger högre än GB300 NVL72.

Prestandavinsterna tillskrivs full-stack co-design, inklusive förbättrade Tensor Cores, Transformer Engine och NVFP4-precision, vilket minskar minnesfotavtrycket för modellvikter, uppmärksamhet och KV-cache. Inlämningarna använde kraftigt uppdelad servering, separerade förfyllnings- och avkodningsstadier, tillsammans med storskalig expertparallellism för blandning av expertskikt. NVL72-uppskalningsdomänen, som drivs av sjätte generationens NVLink och NVLink Switch, gav den sammankopplingsgrund som var nödvändig för dessa tekniker i rackskala.

NVIDIA lyfte också fram skalningseffektivitet och noterade att DeepSeek-R1-inlämningen skalades från ett enda GB300 NVL72-rack till fyra rack (288 GPU: er) med 99 % skalningseffektivitet i offline-scenariot. I agentarbetsbelastningar, närmare bestämt SemiAnalysis AgentX benchmark, levererade Vera Rubin NVL72 30 gånger bättre prestanda än GB300 NVL72 i förhandsgranskningstestning. Partner Nebius skickade också in Vera Rubin NVL72 förhandsgranskningsresultat, som visar liknande prestandaegenskaper.

Releasen inkluderar resultat från det bredare NVIDIA-ekosystemet, med 19 partners som skickar in data, inklusive ASUS, Azure, Cisco, CoreWeave och Oracle Cloud Infrastructure. NVIDIA skickade också in Jetson AGX Thor-resultat med TensorRT Edge-LLM på det nya Edge-Agentic benchmark med Qwen3.6-27B. Resultat efter inlämning för GPT-OSS-120B och DLRMv3 visade ytterligare vinster men är ännu inte verifierade av MLCommons.

Källinformation: blogs.nvidia.com ↗

Varför det spelar roll

Dessa resultat ger konkreta bevis på prestandabanan för nästa generations AI-inferensinfrastruktur, vilket direkt påverkar kostnaden per token-ekonomi för organisationer som använder stora språkmodeller. Genom att demonstrera nästan linjär skalningseffektivitet över flera rack och avsevärda vinster i agentarbetsbelastningar, hjälper data företag att förutsäga infrastrukturkrav och validera den ekonomiska bärkraften av att skala AI-distributioner. Detta är viktigt eftersom slutledningskostnader är en primär drivkraft för AI-produktens lönsamhet och tillgänglighet.

Den primära betydelsen av dessa resultat ligger i kvantifieringen av slutledningsekonomi. Genom att visa att varje Vera Rubin NVL72-rack kan generera betydligt fler tokens och tjäna fler användare än ett GB300 NVL72-rack, ger NVIDIA ett tydligt mått för kostnad-per-token-reduktion. Detta är avgörande för organisationer där slutledningskostnader utgör en stor del av driftskostnaderna, eftersom det direkt översätts till högre intäktspotential eller lägre servicekostnader för samma arbetsbelastning.

Betoningen på skalningseffektivitet adresserar en vanlig smärtpunkt i AI-infrastruktur: det icke-linjära förhållandet mellan hårdvarutillägg och genomströmningsvinster. Att uppnå 99 % skalningseffektivitet över 288 GPU:er tyder på att arkitekturen och sammankopplingarna effektivt mildrar kommunikationsflaskhalsar, vilket gör att organisationer kan förutsäga prestandavinster mer exakt när de utökar sina AI-fabriker.

Inkluderandet av riktmärken för agenter för arbetsbelastning, såsom SemiAnalysis AgentX, signalerar en förändring i hur AI-prestanda mäts. När AI-system går från envarvssvar till flerstegsresonemang och handling, kanske traditionella genomströmningsstatistik inte helt fångar nyttan. 30x prestandaförbättringen i denna specifika domän indikerar att nästa generations hårdvara är specifikt optimerad för latens- och beräkningskraven från agent AI, som är en växande sektor inom företagsapplikationer.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Vad du ska titta på härnäst

Övervaka den slutliga verifieringen av dessa resultat av MLCommons och den efterföljande lanseringen av Vera Rubin-plattformen på marknaden. Spåra dessutom antagandet av det nya MLPerf Endpoints-riktmärket för agentinferens, som kommer att standardisera prestandamått för multi-stegs AI-agenter, och observera hur konkurrenter reagerar på dessa specifika riktmärken för genomströmning och skalningseffektivitet.

Den slutliga verifieringen av dessa förhandsgranskningsresultat av MLCommons är det omedelbara nästa steget. Tills de har verifierats är dessa siffror preliminära och kan komma att ändras. Den officiella releasen kommer att ge den definitiva prestandabaslinjen för Vera Rubin-plattformen.

Marknadens tillgänglighet och prissättning av Vera Rubin NVL72-plattformen kommer att avgöra dess praktiska inverkan. Medan prestandavinsterna är dokumenterade, kommer kostnaden för hårdvaran och övergångsperioden från GB300 att påverka användningshastigheten. Organisationer kommer att behöva väga resultatfördelarna mot de kapitalutgifter som krävs för uppgraderingen.

Utvecklingen och antagandet av MLPerf Endpoints benchmark för agentiska slutsatser kommer att vara avgörande. När detta riktmärke blir standardiserat kommer det att ge en mer heltäckande bild av AI-systemets kapacitet bortom rå token-genomströmning, vilket potentiellt kan omforma hur leverantörer marknadsför och jämför sina plattformar.

Relaterade guider och frågesporter

AI-modeller förklarasAI utbildningAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?