Vissza a Hírekhez
InnovációAI Understanding eligazítás

A NVIDIA Vera Rubin NVL72 az MLPerf Inference v6.1 eredményeit vezeti

A NVIDIA közzétette az előnézeti eredményeket, amelyek szerint a Vera Rubin NVL72 akár 3,7-szer nagyobb átviteli sebességet ér el, mint a GB300 NVL72 a Qwen3-VL és 2,5-szeres a DeepSeek-R1 rendszeren az MLPerf Inference v6.1 programcsomagban.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
Elsődleges forrású dokumentumForrás rögzített
Kiadó
blogs.nvidia.com
Forrás link
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Következtetés
Az a futásidejű fázis, amelyben egy betanított modell előrejelzéseket vagy kimeneteket generál.
Nagy nyelvű modell (LLM)
Hatalmas szövegkorpusokra kiképzett nyelvi modell szöveg generálására és elemzésére.
Memória (ügynökmemória)
Tárolt kontextus, amelyet az AI-ügynök több lépésben vagy munkamenetben használ a folytonosság javítása érdekében.
Teszteld magadAI modellek magyarázata kvíz

Mi történt

A NVIDIA előzetes teljesítményadatokat nyújtott be Vera Rubin NVL72 platformjához az MLPerf v6.1 benchmark csomaghoz, ami jelentős átviteli javulást mutat az előző generációs GB300 NVL72-hez képest. Az eredmények akár 3,7-szer nagyobb átviteli sebességet jeleznek a Qwen3-VL benchmarkon és 2,5-szer nagyobb átviteli sebességet a DeepSeek-R1 esetében, amelyet a hardver-szoftver közös tervezés, az NVFP4 precízió és a szétválasztott kiszolgálási technikák hajtanak végre.

A NVIDIA közzétette a Vera Rubin NVL72 platform előnézeti eredményeit az MLPerf v6.1 programcsomagban, a DeepSeek-R1 és Qwen3-VL benchmarkokra összpontosítva. A vállalat arról számolt be, hogy a Vera Rubin NVL72 akár 3,7-szer nagyobb átviteli sebességet biztosít, mint a GB300 NVL72 Qwen3-VL-en offline, szerver és interaktív forgatókönyvekben, ha a vLLM NVIDIA Dynamo nyílt forráskódú következtetési keretrendszerrel együtt használja. A DeepSeek-R1 benchmark esetében a NVIDIA TensorRT-LLM könyvtárat használva az átviteli sebesség akár 2,5-szer nagyobb volt, mint a GB300 NVL72.

A teljesítménynövekedés a full-stack co-dizájnnak köszönhető, beleértve a továbbfejlesztett Tensor Core-okat, a Transformer Engine-t és az NVFP4 pontosságot, amely csökkenti a memória helyigényét a modell súlya, a figyelem és a KV gyorsítótár számára. A beadványok nagymértékben használták a bontott kiszolgálást, elválasztva az előtöltési és dekódolási szakaszokat, valamint a szakértői rétegek széles körű szakértői párhuzamosságát. A hatodik generációs NVLink és NVLink Switch által működtetett NVL72 skálázási tartomány biztosította a rack méretű technikákhoz szükséges összekapcsolási alapot.

A NVIDIA kiemelte a skálázási hatékonyságot is, megjegyezve, hogy a DeepSeek-R1 benyújtott egyetlen GB300 NVL72 rackről négy rackre (288 GPU) skálázódott, offline forgatókönyv esetén 99%-os skálázási hatékonysággal. Ügynöki munkaterheléseknél, különösen a SemiAnalysis AgentX benchmarknál, a Vera Rubin NVL72 30-szor jobb teljesítményt nyújtott, mint a GB300 NVL72 az előzetes tesztelés során. A Nebius partner szintén benyújtotta a Vera Rubin NVL72 előnézeti eredményeit, amelyek hasonló teljesítményjellemzőket mutatnak be.

A kiadás a tágabb NVIDIA ökoszisztéma eredményeit tartalmazza, 19 partnerrel, köztük az ASUS, az Azure, a Cisco, a CoreWeave és az Oracle Cloud Infrastructure adataival. A NVIDIA a Jetson AGX Thor eredményeit is benyújtotta a TensorRT Edge-LLM használatával a Qwen3.6-27B új Edge-Agentic benchmarkon. A GPT-OSS-120B és a DLRMv3 beküldése utáni eredményei további javulást mutattak, de az MLCommons még nem ellenőrizte őket.

Forrás részletei: blogs.nvidia.com ↗

Miért számít

Ezek az eredmények konkrét bizonyítékot szolgáltatnak a következő generációs mesterséges intelligencia-következtetési infrastruktúra teljesítménypályájáról, amely közvetlenül befolyásolja a nagy nyelvi modelleket alkalmazó szervezetek tokenenkénti költségének gazdaságosságát. Az adatok közel lineáris skálázási hatékonyságot mutatnak be több állványon és jelentős mértékben növelik az ügynöki munkaterhelést, így az adatok segítik a vállalatokat az infrastruktúra-szükségletek előrejelzésében és a skálázható mesterségesintelligencia-telepítések gazdasági életképességének ellenőrzésében. Ez azért fontos, mert a következtetési költségek az AI-termékek jövedelmezőségének és hozzáférhetőségének elsődleges mozgatórugói.

Ezen eredmények elsődleges jelentősége a következtetési közgazdaságtan számszerűsítésében rejlik. Azzal, hogy bemutatja, hogy minden Vera Rubin NVL72 rack lényegesen több tokent képes generálni és több felhasználót kiszolgálni, mint egy GB300 NVL72 rack, a NVIDIA egyértelmű mérőszámot biztosít a tokenenkénti költség csökkentésére. Ez kritikus fontosságú azoknál a szervezeteknél, ahol a következtetési költségek a működési költségek jelentős részét teszik ki, mivel ez közvetlenül magasabb bevételi potenciált vagy alacsonyabb szolgáltatási költségeket jelent ugyanazon munkaterhelés mellett.

A skálázási hatékonyságra helyezett hangsúly a mesterséges intelligencia infrastruktúrájának egy közös problémájára vonatkozik: a hardver-kiegészítés és az áteresztőképesség-növekedés közötti nemlineáris kapcsolatra. A 99%-os skálázási hatékonyság elérése 288 GPU-n azt sugallja, hogy az architektúra és az összekapcsolások hatékonyan csökkentik a kommunikációs szűk keresztmetszetek kialakulását, lehetővé téve a szervezetek számára, hogy pontosabban előre jelezzék a teljesítménynövekedést AI-gyáraik bővítésekor.

Az ügynöki munkaterhelési benchmarkok, például a SemiAnalysis AgentX felvétele az AI-teljesítmény mérésének elmozdulását jelzi. Ahogy a mesterséges intelligencia rendszerek az egyfordulós válaszoktól a többlépcsős érvelés és cselekvés felé mozdulnak el, előfordulhat, hogy a hagyományos átviteli mérőszámok nem képesek teljes mértékben rögzíteni a hasznosságot. A 30-szoros teljesítménynövekedés ezen a tartományon azt jelzi, hogy a következő generációs hardvert kifejezetten az ügynöki mesterséges intelligencia késleltetési és számítási igényeire optimalizálták, amely a vállalati alkalmazások egyre növekvő ágazata.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktív koncepció ellenőrzése+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Mit nézzünk ezután

Kövesse nyomon ezeknek az eredményeknek az MLCommons általi végső ellenőrzését és a Vera Rubin platform ezt követő piacra bocsátását. Ezenkívül nyomon követheti az új MLPerf Endpoints benchmark alkalmazását az ügynöki következtetésekhez, amely szabványosítja a többlépcsős AI-ügynökök teljesítménymutatóit, és figyelje meg, hogyan reagálnak a versenytársak ezekre a specifikus átviteli és skálázási hatékonysági referenciaértékekre.

Az előnézeti eredmények végső ellenőrzése az MLCommons által a következő lépés. Ellenőrzésig ezek a számok előzetesek és változhatnak. A hivatalos kiadás biztosítja a Vera Rubin platform végső teljesítményének alapvonalát.

A Vera Rubin NVL72 platform piaci elérhetősége és ára határozza meg annak gyakorlati hatását. Bár a teljesítménynövekedés dokumentálva van, a hardver költsége és a GB300-ról való átmeneti időszak befolyásolja az elfogadási arányt. A szervezeteknek mérlegeniük kell a teljesítmény-előnyöket a frissítéshez szükséges tőkeráfordítással.

Az ügynöki következtetések MLPerf Endpoints referenciaértékének kidolgozása és elfogadása kulcsfontosságú lesz. Amint ez a benchmark szabványossá válik, átfogóbb képet fog adni az AI-rendszer képességeiről a nyers token átviteli sebességen túlmenően, és potenciálisan átalakítja a szállítók piacát és platformjaik összehasonlítását.

Kapcsolódó útmutatók és vetélkedők

Az AI modellek magyarázataAI képzésAz MI jövőjeTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?