Buyela Ezindabeni
UkuqambaAI Understanding ukwaziswa

Amaposi we-NVIDIA Vera Rubin NVL72 ahola imiphumela ye-MLPerf Inference v6.1

I-NVIDIA ikhiphe imiphumela yokubuka kuqala ebonisa ukuthi u-Vera Rubin NVL72 ufinyelela ku-3.7x ngaphezulu kokuphuma okuphezulu kune-GB300 NVL72 ku-Qwen3-VL kanye no-2.5x ku-DeepSeek-R1 ku-MLPerf Inference v6.1 suite.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
Idokhumenti yomthombo oyinhlokoUmthombo urekhodiwe
Umshicileli
blogs.nvidia.com
Isixhumanisi somthombo
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Uhlobo lomthombo
Idokhumenti eyisisekelo — isimemezelo esisemthethweni, iphepha, ukugcwalisa, noma ikhasi lomuntu wokuqala esilifunda ngokuqondile.
UmongoQonda lokhu ngemizuzwana engama-60

Qala lapha

Imigomo ebalulekile

Incazelo
Isigaba sesikhathi sokusebenza lapho imodeli eqeqeshiwe ikhiqiza ukuqagela noma okuphumayo.
Imodeli Yolimi Olukhulu (LLM)
Imodeli yolimi eqeqeshwe ku-massive text corpora ukuze ikhiqize futhi ihlaziye umbhalo.
Inkumbulo (Inkumbulo yomenzeli)
Ingqikithi egciniwe umenzeli we-AI usebenzisa ezinyathelweni zonke noma izikhathi ukuze athuthukise ukuqhubeka.
ZihloleImibuzo Ecacisiwe yamamodeli e-AI

Kwenzekeni

I-NVIDIA ithumele idatha yokubuka kuqala yokusebenza kwenkundla yayo ye-Vera Rubin NVL72 ku-MLPerf v6.1 benchmark suite, ebonisa ukuthuthuka okuphawulekayo kokusebenza kusizukulwane sangaphambilini i-GB300 NVL72. Imiphumela ikhombisa ukufinyelela okufika kokungu-3.7x okuphezulu kubhentshimakhi ye-Qwen3-VL kanye nokuphuma okuphezulu okungu-2.5x ku-DeepSeek-R1, eqhutshwa i-hardware-software co-design, ukunemba kwe-NVFP4, nezindlela zokuphakela ezihlukanisiwe.

I-NVIDIA ikhiphe imiphumela yokubuka kuqala yenkundla ye-Vera Rubin NVL72 ku-MLPerf v6.1 suite, egxile kumabhentshimakhi we-DeepSeek-R1 kanye ne-Qwen3-VL. Inkampani ibike ukuthi i-Vera Rubin NVL72 iletha okokusebenza okuphezulu okufika ku-3.7x kune-GB300 NVL72 ku-Qwen3-VL kuzo zonke izimo ezingaxhunyiwe ku-inthanethi, iseva, nezimo ezisebenzisanayo lapho usebenzisa i-vLLM ngohlaka lwe-NVIDIA Dynamo oluvulekile lomthombo wokukhomba. Okwebhentshimakhi ye-DeepSeek-R1, kusetshenziswa umtapo wezincwadi we-NVIDIA TensorRT-LLM, okuphumayo bekufike ku-2.5x ngaphezulu kwe-GB300 NVL72.

Ukuzuza kokusebenza kudalwe ukudizayinwa okugcwele kwesitaki esigcwele, okuhlanganisa i-Tensor Cores ethuthukisiwe, i-Transformer Engine, kanye nokunemba kwe-NVFP4, okunciphisa inkumbulo yesisindo semodeli, ukunakwa, nesilondolozi se-KV. Okuthunyelwe kusetshenziswe kakhulu ukunikeza okuhlukanisiwe, okuhlukanisa izigaba zokugcwalisa nokukhipha ikhodi, kanye nokufana kochwepheshe okukhulu kwezendlalelo ezixubile zochwepheshe. Isizinda sokukhula kwesikali se-NVL72, esinikwa amandla i-NVLink yesizukulwane sesithupha ne-NVLink Switch, sinikeze isisekelo sokuxhuma esidingekayo kulawa maqhinga esikalini sokubeka.

I-NVIDIA iphinde yagqamisa ukusebenza kahle kokukalwa, iphawula ukuthi ukuhanjiswa kwe-DeepSeek-R1 kulinganiswe kusuka kurack eyodwa ye-GB300 NVL72 kuya kuma-rack amane (288 GPUs) ngokusebenza kahle kokukalwa okungu-99% esimweni esingaxhunyiwe ku-inthanethi. Emithwalweni yokusebenza ye-agency, ikakhulukazi ibhentshimakhi ye-SemiAnalysis AgentX, i-Vera Rubin NVL72 ilethe ukusebenza okungcono okungu-30x kune-GB300 NVL72 ekuhloleni ukuhlola kuqala. Uzakwethu uNebius uphinde wahambisa imiphumela yokubuka kuqala ye-Vera Rubin NVL72, ebonisa izici zokusebenza ezifanayo.

Ukukhishwa kuhlanganisa imiphumela evela kuhlelo olubanzi lwe-NVIDIA, nozakwethu abangu-19 abathumela idatha, okuhlanganisa i-ASUS, i-Azure, i-Cisco, i-CoreWeave, ne-Oracle Cloud Infrastructure. I-NVIDIA iphinde yathumela imiphumela ye-Jetson AGX Thor isebenzisa i-TensorRT Edge-LLM kubhentshimakhi entsha ye-Edge-Agentic ene-Qwen3.6-27B. Imiphumela yangemuva kokuthunyelwa ye-GPT-OSS-120B kanye ne-DLRMv3 ibonise izinzuzo ezengeziwe kodwa azikakaqinisekiswa yi-MLCommons.

Imininingwane yomthombo: blogs.nvidia.com ↗

Kungani kubalulekile

Le miphumela ihlinzeka ngobufakazi obuphathekayo bendlela yokusebenza yengqalasizinda ye-AI yesizukulwane esilandelayo, okuthinta ngokuqondile umnotho wezindleko ngethokheni ezinhlanganweni ezithumela amamodeli ezilimi ezinkulu. Ngokubonisa ukusebenza kahle kwesikali esiseduze komugqa kuwo wonke ama-rack amaningi kanye nezinzuzo ezinkulu kumthwalo wemisebenzi ye-ejenti, idatha isiza amabhizinisi izimfuneko zengqalasizinda futhi iqinisekise ukusebenza kahle kwezomnotho kokukala ukuthunyelwa kwe-AI. Lokhu kubalulekile ngoba izindleko zokucatshangelwa zingumshayeli oyinhloko wenzuzo yomkhiqizo we-AI nokufinyeleleka.

Ukubaluleka okuyinhloko kwale miphumela kusekulinganisweni kwezomnotho okucatshangwayo. Ngokubonisa ukuthi i-rack ye-Vera Rubin NVL72 ngayinye ingakhiqiza amathokheni amaningi kakhulu futhi isebenze abasebenzisi abaningi kune-rack ye-GB300 NVL72, i-NVIDIA inikeza imethrikhi ecacile yokunciphisa izindleko ngethokheni ngayinye. Lokhu kubalulekile ezinhlanganweni lapho izindleko zokucatshangelwa zenza ingxenye enkulu yezindleko zokusebenza, njengoba zihumusha ngokuqondile amandla emali engenayo ephakeme noma izindleko eziphansi zesevisi zomthwalo ofanayo womsebenzi.

Ukugcizelelwa kokusebenza kahle kokukala kubhekana nephuzu elivamile lobuhlungu kwingqalasizinda ye-AI: ubudlelwano obungewona umugqa phakathi kokwengezwa kwehadiwe kanye nenzuzo yokuphuma. Ukuzuza ukusebenza kahle kokukala okungu-99% kuwo wonke ama-GPU angu-288 kuphakamisa ukuthi ukwakheka nokuxhumanisa kunciphisa ngempumelelo izithiyo zokuxhumana, okuvumela izinhlangano ukuthi zibikezele izinzuzo zokusebenza ngokunembe kakhulu lapho zandisa izimboni zazo ze-AI.

Ukufakwa kwamabhentshimakhi womthwalo womsebenzi we-ejenti, njenge-SemiAnalysis AgentX, kubonisa ushintsho endleleni ukusebenza kwe-AI kukalwa ngayo. Njengoba amasistimu e-AI asuka ezimpendulweni zokuphenduka okukodwa aye ekucabangeni okunezinyathelo eziningi kanye nesenzo, amamethrikhi okusebenza endabuko angase angathwebuli ngokugcwele ukusetshenziswa. Ukuthuthukiswa kokusebenza okungu-30x kulesi sizinda esithile kukhombisa ukuthi izingxenyekazi zekhompyutha zesizukulwane esilandelayo zenzelwe ngokukhethekile ukubambezeleka kanye nezidingo zekhompyutha ze-agent AI, okuwumkhakha okhulayo ezinhlelweni zebhizinisi.

Interactive Mechanism

I-Interactive Mechanism: Indlela Esebenza Ngayo Ngempela

Hlola ubuchwepheshe obuyisisekelo ngemuva kwalokhu kuthuthukiswa ngokuhlanganyela.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
I-Interactive Concept Check+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ongakubuka ngokulandelayo

Gada ukuqinisekiswa kokugcina kwale miphumela yi-MLCommons kanye nokukhishwa okulandelayo kwenkundla ye-Vera Rubin emakethe. Ukwengeza, landelela ukwamukelwa kwebhentshimakhi entsha ye-MLPerf Endpoints ukuze kutholwe i-ejenti, ezomisa amamethrikhi okusebenza kuma-ejenti we-AI wezinyathelo eziningi, futhi ubheke ukuthi izimbangi zisabela kanjani kulawa mabhentshimakhi athile wokusebenza kanye nokukala ukusebenza kahle.

Ukuqinisekiswa kokugcina kwale miphumela yokubuka kuqala yi-MLCommons isinyathelo esilandelayo esisheshayo. Kuze kube yilapho seziqinisekisiwe, lezi zinombolo ngezandulela futhi zingashintsha. Ukukhishwa okusemthethweni kuzohlinzeka ngesisekelo esiqondile sokusebenza senkundla ye-Vera Rubin.

Ukutholakala kwemakethe kanye nentengo yesikhulumi se-Vera Rubin NVL72 kuzonquma umthelela wayo ongokoqobo. Ngenkathi izinzuzo zokusebenza zibhaliwe, izindleko zehadiwe kanye nesikhathi soshintsho ukusuka ku-GB300 kuzoba nomthelela emazingeni okutholwa. Izinhlangano kuzodingeka zikale izinzuzo zokusebenza ngokuqhathanisa nezindleko zempahla edingekayo ukuze kuthuthukiswe.

Ukuthuthukiswa nokwamukelwa kwebhentshimakhi ye-MLPerf Endpoints ukuze kutholwe i-ejenti kuzobaluleka. Njengoba le bhentshimakhi iba sezingeni, izohlinzeka ngombono obanzi kakhudlwana wamakhono esistimu ye-AI ngale kokuphuma kwamathokheni okungahluziwe, okungase kumise kabusha indlela abathengisi abamaketha ngayo futhi baqhathanise izinkundla zabo.

Imihlahlandlela ehlobene nemibuzo

Amamodeli e-AI AchaziweUkuqeqeshwa kwe-AIIkusasa le-AIHlola okwaziyo — zama imibuzo ye-AI yamahhalaBheka igama le-AI kuhlu lwethu lwamagamaLandela i-tracker yokukhishwa kwemodeli ye-AI
Uthole lokhu kuwusizo?