Terug naar Nieuws
InnovatieAI Understanding-briefing

NVIDIA Vera Rubin NVL72 boekt toonaangevende MLPerf Inference v6.1-resultaten

NVIDIA heeft preview-resultaten vrijgegeven waaruit blijkt dat Vera Rubin NVL72 een tot 3,7x hogere doorvoer bereikt dan GB300 NVL72 op Qwen3-VL en 2,5x op DeepSeek-R1 in de MLPerf Inference v6.1 suite.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
Primair brondocumentBron opgenomen
Uitgever
blogs.nvidia.com
Bronlink
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Gevolgtrekking
De runtimefase waarin een getraind model voorspellingen of uitvoer genereert.
Groot taalmodel (LLM)
Een taalmodel dat is getraind op enorme tekstcorpora om tekst te genereren en te analyseren.
Geheugen (agentgeheugen)
Opgeslagen context die een AI-agent in stappen of sessies gebruikt om de continuïteit te verbeteren.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

NVIDIA heeft preview-prestatiegegevens voor zijn Vera Rubin NVL72-platform ingediend bij de MLPerf v6.1 benchmarksuite, wat aanzienlijke doorvoerverbeteringen aantoont ten opzichte van de vorige generatie GB300 NVL72. De resultaten duiden op een tot 3,7x hogere doorvoer op de Qwen3-VL benchmark en 2,5x hogere doorvoer op de DeepSeek-R1, aangedreven door hardware-software co-design, NVFP4-precisie en opgesplitste serveertechnieken.

NVIDIA heeft preview-resultaten vrijgegeven voor het Vera Rubin NVL72-platform in de MLPerf v6.1-suite, met de nadruk op de DeepSeek-R1- en Qwen3-VL-benchmarks. Het bedrijf meldde dat Vera Rubin NVL72 tot 3,7x hogere doorvoer levert dan de GB300 NVL72 op Qwen3-VL in offline, server- en interactieve scenario's bij gebruik van vLLM met het NVIDIA Dynamo open-source inferentieframework. Voor de DeepSeek-R1 benchmark, die de NVIDIA TensorRT-LLM-bibliotheek gebruikte, was de doorvoer tot 2,5x hoger dan die van de GB300 NVL72.

De prestatieverbeteringen worden toegeschreven aan full-stack co-design, inclusief verbeterde Tensor Cores, de Transformer Engine en NVFP4-precisie, die de geheugenvoetafdruk voor modelgewichten, aandacht en KV-cache vermindert. De inzendingen maakten intensief gebruik van gedesaggregeerde weergave, waarbij de fasen voor het invullen en decoderen werden gescheiden, samen met grootschalig parallellisme van deskundigen voor lagen van mengsels van deskundigen. Het NVL72-opschalingsdomein, mogelijk gemaakt door NVLink en NVLink Switch van de zesde generatie, zorgde voor de interconnect-fundament die nodig is voor deze technieken op rackschaal.

NVIDIA benadrukte ook de schaalefficiëntie en merkte op dat de DeepSeek-R1-inzending schaalde van een enkel GB300 NVL72-rack naar vier racks (288 GPU's) met een schaalefficiëntie van 99% in het offline scenario. Bij agentische workloads, met name de SemiAnalysis AgentX-benchmark, leverde Vera Rubin NVL72 30x betere prestaties dan GB300 NVL72 in preview-tests. Partner Nebius heeft ook Vera Rubin NVL72 preview-resultaten ingediend, waaruit vergelijkbare prestatiekenmerken blijken.

De release bevat resultaten van het bredere NVIDIA-ecosysteem, waarbij 19 partners gegevens indienen, waaronder ASUS, Azure, Cisco, CoreWeave en Oracle Cloud Infrastructure. NVIDIA heeft ook Jetson AGX Thor-resultaten ingediend met behulp van TensorRT Edge-LLM op de nieuwe Edge-Agentic-benchmark met Qwen3.6-27B. Resultaten na indiening voor GPT-OSS-120B en DLRMv3 lieten verdere winst zien, maar zijn nog niet geverifieerd door MLCommons.

Brongegevens: blogs.nvidia.com ↗

Waarom het ertoe doet

Deze resultaten leveren concreet bewijs van het prestatietraject voor de AI-inferentie-infrastructuur van de volgende generatie, wat een directe impact heeft op de kosten per token-economie voor organisaties die grote taalmodellen inzetten. Door bijna lineaire schaalefficiëntie over meerdere racks en substantiële winsten in agentic workloads aan te tonen, helpen de gegevens bedrijven bij het voorspellen van infrastructuurvereisten en het valideren van de economische haalbaarheid van het opschalen van AI-implementaties. Dit is van belang omdat gevolgtrekkingskosten een van de belangrijkste factoren zijn voor de winstgevendheid en toegankelijkheid van AI-producten.

Het voornaamste belang van deze resultaten ligt in de kwantificering van de inferentie-economie. Door aan te tonen dat elk Vera Rubin NVL72-rack aanzienlijk meer tokens kan genereren en meer gebruikers kan bedienen dan een GB300 NVL72-rack, biedt NVIDIA een duidelijke maatstaf voor de reductie van de kosten per token. Dit is van cruciaal belang voor organisaties waar gevolgtrekkingskosten een groot deel van de operationele kosten uitmaken, omdat dit zich direct vertaalt in een hoger omzetpotentieel of lagere servicekosten voor dezelfde werklast.

De nadruk op schaalefficiëntie pakt een veelvoorkomend pijnpunt in de AI-infrastructuur aan: de niet-lineaire relatie tussen hardwaretoevoeging en doorvoerwinst. Het bereiken van een schaalefficiëntie van 99% over 288 GPU's suggereert dat de architectuur en onderlinge verbindingen communicatieknelpunten effectief verminderen, waardoor organisaties prestatieverbeteringen nauwkeuriger kunnen voorspellen bij het uitbreiden van hun AI-fabrieken.

De opname van agentische werklastbenchmarks, zoals SemiAnalysis AgentX, signaleert een verschuiving in de manier waarop AI-prestaties worden gemeten. Naarmate AI-systemen evolueren van reacties in één keer naar redeneren en handelen in meerdere stappen, is het mogelijk dat traditionele doorvoerstatistieken het nut niet volledig weergeven. De prestatieverbetering van 30x in dit specifieke domein geeft aan dat hardware van de volgende generatie specifiek is geoptimaliseerd voor de latentie- en rekenvereisten van agentische AI, een groeiende sector in bedrijfsapplicaties.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

Houd toezicht op de definitieve verificatie van deze resultaten door MLCommons en de daaropvolgende release van het Vera Rubin-platform op de markt. Volg daarnaast de adoptie van de nieuwe MLPerf Endpoints-benchmark voor agentic , die de prestatiestatistieken voor meerstaps AI-agents zal standaardiseren, en observeer hoe concurrenten reageren op deze specifieke benchmarks voor doorvoer en schaalefficiëntie.

De definitieve verificatie van deze preview-resultaten door MLCommons is de onmiddellijke volgende stap. Totdat ze zijn geverifieerd, zijn deze cijfers voorlopig en kunnen ze worden gewijzigd. De officiële release zal de definitieve prestatiebasislijn bieden voor het Vera Rubin-platform.

De marktbeschikbaarheid en prijsstelling van het Vera Rubin NVL72-platform zullen de praktische impact ervan bepalen. Hoewel de prestatieverbeteringen gedocumenteerd zijn, zullen de kosten van de hardware en de overgangsperiode van GB300 de acceptatiegraad beïnvloeden. Organisaties zullen de prestatievoordelen moeten afwegen tegen de kapitaaluitgaven die nodig zijn voor de upgrade.

De ontwikkeling en acceptatie van de MLPerf Endpoints-benchmark voor agentische inferentie zal van cruciaal belang zijn. Naarmate deze benchmark wordt gestandaardiseerd, zal deze een uitgebreider beeld bieden van de mogelijkheden van AI-systemen die verder gaan dan de doorvoer van ruwe tokens, waardoor mogelijk de manier waarop leveranciers hun platforms op de markt brengen en vergelijken, kan veranderen.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-trainingToekomst van AITest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?