Mi történt
A NVIDIA előzetes teljesítményadatokat nyújtott be Vera Rubin NVL72 platformjához az MLPerf v6.1 benchmark csomaghoz, ami jelentős átviteli javulást mutat az előző generációs GB300 NVL72-hez képest. Az eredmények akár 3,7-szer nagyobb átviteli sebességet jeleznek a Qwen3-VL benchmarkon és 2,5-szer nagyobb átviteli sebességet a DeepSeek-R1 esetében, amelyet a hardver-szoftver közös tervezés, az NVFP4 precízió és a szétválasztott kiszolgálási technikák hajtanak végre.
A NVIDIA közzétette a Vera Rubin NVL72 platform előnézeti eredményeit az MLPerf v6.1 programcsomagban, a DeepSeek-R1 és Qwen3-VL benchmarkokra összpontosítva. A vállalat arról számolt be, hogy a Vera Rubin NVL72 akár 3,7-szer nagyobb átviteli sebességet biztosít, mint a GB300 NVL72 Qwen3-VL-en offline, szerver és interaktív forgatókönyvekben, ha a vLLM NVIDIA Dynamo nyílt forráskódú következtetési keretrendszerrel együtt használja. A DeepSeek-R1 benchmark esetében a NVIDIA TensorRT-LLM könyvtárat használva az átviteli sebesség akár 2,5-szer nagyobb volt, mint a GB300 NVL72.
A teljesítménynövekedés a full-stack co-dizájnnak köszönhető, beleértve a továbbfejlesztett Tensor Core-okat, a Transformer Engine-t és az NVFP4 pontosságot, amely csökkenti a memória helyigényét a modell súlya, a figyelem és a KV gyorsítótár számára. A beadványok nagymértékben használták a bontott kiszolgálást, elválasztva az előtöltési és dekódolási szakaszokat, valamint a szakértői rétegek széles körű szakértői párhuzamosságát. A hatodik generációs NVLink és NVLink Switch által működtetett NVL72 skálázási tartomány biztosította a rack méretű technikákhoz szükséges összekapcsolási alapot.
A NVIDIA kiemelte a skálázási hatékonyságot is, megjegyezve, hogy a DeepSeek-R1 benyújtott egyetlen GB300 NVL72 rackről négy rackre (288 GPU) skálázódott, offline forgatókönyv esetén 99%-os skálázási hatékonysággal. Ügynöki munkaterheléseknél, különösen a SemiAnalysis AgentX benchmarknál, a Vera Rubin NVL72 30-szor jobb teljesítményt nyújtott, mint a GB300 NVL72 az előzetes tesztelés során. A Nebius partner szintén benyújtotta a Vera Rubin NVL72 előnézeti eredményeit, amelyek hasonló teljesítményjellemzőket mutatnak be.
A kiadás a tágabb NVIDIA ökoszisztéma eredményeit tartalmazza, 19 partnerrel, köztük az ASUS, az Azure, a Cisco, a CoreWeave és az Oracle Cloud Infrastructure adataival. A NVIDIA a Jetson AGX Thor eredményeit is benyújtotta a TensorRT Edge-LLM használatával a Qwen3.6-27B új Edge-Agentic benchmarkon. A GPT-OSS-120B és a DLRMv3 beküldése utáni eredményei további javulást mutattak, de az MLCommons még nem ellenőrizte őket.
Forrás részletei: blogs.nvidia.com ↗
Miért számít
Ezek az eredmények konkrét bizonyítékot szolgáltatnak a következő generációs mesterséges intelligencia-következtetési infrastruktúra teljesítménypályájáról, amely közvetlenül befolyásolja a nagy nyelvi modelleket alkalmazó szervezetek tokenenkénti költségének gazdaságosságát. Az adatok közel lineáris skálázási hatékonyságot mutatnak be több állványon és jelentős mértékben növelik az ügynöki munkaterhelést, így az adatok segítik a vállalatokat az infrastruktúra-szükségletek előrejelzésében és a skálázható mesterségesintelligencia-telepítések gazdasági életképességének ellenőrzésében. Ez azért fontos, mert a következtetési költségek az AI-termékek jövedelmezőségének és hozzáférhetőségének elsődleges mozgatórugói.
Ezen eredmények elsődleges jelentősége a következtetési közgazdaságtan számszerűsítésében rejlik. Azzal, hogy bemutatja, hogy minden Vera Rubin NVL72 rack lényegesen több tokent képes generálni és több felhasználót kiszolgálni, mint egy GB300 NVL72 rack, a NVIDIA egyértelmű mérőszámot biztosít a tokenenkénti költség csökkentésére. Ez kritikus fontosságú azoknál a szervezeteknél, ahol a következtetési költségek a működési költségek jelentős részét teszik ki, mivel ez közvetlenül magasabb bevételi potenciált vagy alacsonyabb szolgáltatási költségeket jelent ugyanazon munkaterhelés mellett.
A skálázási hatékonyságra helyezett hangsúly a mesterséges intelligencia infrastruktúrájának egy közös problémájára vonatkozik: a hardver-kiegészítés és az áteresztőképesség-növekedés közötti nemlineáris kapcsolatra. A 99%-os skálázási hatékonyság elérése 288 GPU-n azt sugallja, hogy az architektúra és az összekapcsolások hatékonyan csökkentik a kommunikációs szűk keresztmetszetek kialakulását, lehetővé téve a szervezetek számára, hogy pontosabban előre jelezzék a teljesítménynövekedést AI-gyáraik bővítésekor.
Az ügynöki munkaterhelési benchmarkok, például a SemiAnalysis AgentX felvétele az AI-teljesítmény mérésének elmozdulását jelzi. Ahogy a mesterséges intelligencia rendszerek az egyfordulós válaszoktól a többlépcsős érvelés és cselekvés felé mozdulnak el, előfordulhat, hogy a hagyományos átviteli mérőszámok nem képesek teljes mértékben rögzíteni a hasznosságot. A 30-szoros teljesítménynövekedés ezen a tartományon azt jelzi, hogy a következő generációs hardvert kifejezetten az ügynöki mesterséges intelligencia késleltetési és számítási igényeire optimalizálták, amely a vállalati alkalmazások egyre növekvő ágazata.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
Kövesse nyomon ezeknek az eredményeknek az MLCommons általi végső ellenőrzését és a Vera Rubin platform ezt követő piacra bocsátását. Ezenkívül nyomon követheti az új MLPerf Endpoints benchmark alkalmazását az ügynöki következtetésekhez, amely szabványosítja a többlépcsős AI-ügynökök teljesítménymutatóit, és figyelje meg, hogyan reagálnak a versenytársak ezekre a specifikus átviteli és skálázási hatékonysági referenciaértékekre.
Az előnézeti eredmények végső ellenőrzése az MLCommons által a következő lépés. Ellenőrzésig ezek a számok előzetesek és változhatnak. A hivatalos kiadás biztosítja a Vera Rubin platform végső teljesítményének alapvonalát.
A Vera Rubin NVL72 platform piaci elérhetősége és ára határozza meg annak gyakorlati hatását. Bár a teljesítménynövekedés dokumentálva van, a hardver költsége és a GB300-ról való átmeneti időszak befolyásolja az elfogadási arányt. A szervezeteknek mérlegeniük kell a teljesítmény-előnyöket a frissítéshez szükséges tőkeráfordítással.
Az ügynöki következtetések MLPerf Endpoints referenciaértékének kidolgozása és elfogadása kulcsfontosságú lesz. Amint ez a benchmark szabványossá válik, átfogóbb képet fog adni az AI-rendszer képességeiről a nyers token átviteli sebességen túlmenően, és potenciálisan átalakítja a szállítók piacát és platformjaik összehasonlítását.