Ce sa întâmplat
NVIDIA a trimis date de performanță de previzualizare pentru platforma sa Vera Rubin NVL72 la suita de benchmark MLPerf v6.1, demonstrând îmbunătățiri semnificative ale randamentului față de generația anterioară GB300 NVL72. Rezultatele indică un randament de până la 3,7 ori mai mare pe benchmark-ul Qwen3-VL și de 2,5 ori mai mare pe DeepSeek-R1, determinat de co-proiectare hardware-software, precizie NVFP4 și tehnici de servire dezagregate.
NVIDIA a lansat rezultatele previzualizării pentru platforma Vera Rubin NVL72 în suita MLPerf v6.1, concentrându-se pe benchmark-urile DeepSeek-R1 și Qwen3-VL. Compania a raportat că Vera Rubin NVL72 oferă o capacitate de transfer de până la 3,7 ori mai mare decât GB300 NVL72 pe Qwen3-VL în scenarii offline, server și interactive atunci când se utilizează vLLM cu cadrul de inferență open-source NVIDIA Dynamo. Pentru benchmarkul DeepSeek-R1, folosind biblioteca NVIDIA TensorRT-LLM, debitul a fost de până la 2,5 ori mai mare decât GB300 NVL72.
Câștigurile de performanță sunt atribuite co-designului full-stack, inclusiv Tensor Cores îmbunătățit, Transformer Engine și precizie NVFP4, care reduce amprenta de memorie pentru greutatea modelului, atenția și memoria cache KV. Înscrierile au folosit în mare măsură servirea dezagregată, separând etapele de precompletare și decodare, împreună cu paralelismul experților la scară largă pentru straturile de amestec de experți. Domeniul de extindere NVL72, alimentat de a șasea generație de NVLink și NVLink Switch, a oferit fundația de interconectare necesară pentru aceste tehnici la scară de rack.
NVIDIA a evidențiat, de asemenea, eficiența de scalare, menționând că trimiterea DeepSeek-R1 a scalat de la un singur rack GB300 NVL72 la patru rack-uri (288 GPU) cu o eficiență de scalare de 99% în scenariul offline. În sarcinile de lucru agentice, în special în benchmark-ul SemiAnalysis AgentX, Vera Rubin NVL72 a furnizat performanțe de 30 de ori mai bune decât GB300 NVL72 în testele de previzualizare. Partenerul Nebius a prezentat și rezultatele previzualizării Vera Rubin NVL72, demonstrând caracteristici de performanță similare.
Lansarea include rezultate din ecosistemul mai larg NVIDIA, cu 19 parteneri care trimit date, inclusiv ASUS, Azure, Cisco, CoreWeave și Oracle Cloud Infrastructure. NVIDIA a prezentat și rezultatele Jetson AGX Thor folosind TensorRT Edge-LLM pe noul benchmark Edge-Agentic cu Qwen3.6-27B. Rezultatele ulterioare trimiterii pentru GPT-OSS-120B și DLRMv3 au arătat câștiguri suplimentare, dar nu sunt încă verificate de MLCommons.
Detalii sursa: blogs.nvidia.com ↗
De ce contează
Aceste rezultate oferă dovezi concrete ale traiectoriei de performanță pentru infrastructura de inferență AI de generație următoare, având un impact direct asupra economiei cost-pe-token pentru organizațiile care implementează modele de limbaj mari. Demonstrând eficiența de scalare aproape liniară pe mai multe rafturi și câștiguri substanțiale în încărcăturile de lucru agentice, datele ajută companiile să prognozeze cerințele de infrastructură și să valideze viabilitatea economică a implementărilor de scalare AI. Acest lucru contează deoarece costurile de inferență sunt un factor principal al profitabilității și accesibilității produselor AI.
Semnificația principală a acestor rezultate constă în cuantificarea economiei inferenței. Demonstrând că fiecare rack Vera Rubin NVL72 poate genera semnificativ mai multe jetoane și poate servi mai mulți utilizatori decât un rack GB300 NVL72, NVIDIA oferă o măsură clară pentru reducerea cost-pe-token. Acest lucru este esențial pentru organizațiile în care costurile de inferență reprezintă o parte majoră a cheltuielilor operaționale, deoarece se traduce direct într-un potențial de venituri mai mari sau costuri mai mici ale serviciilor pentru aceeași sarcină de lucru.
Accentul pus pe scalarea eficienței abordează un punct de durere comun în infrastructura AI: relația neliniară dintre adăugarea de hardware și câștigurile de debit. Atingerea unei eficiențe de scalare de 99% pe 288 de GPU-uri sugerează că arhitectura și interconexiunile atenuează în mod eficient blocajele de comunicare, permițând organizațiilor să prezică cu mai multă precizie câștigurile de performanță atunci când își extind fabricile de AI.
Includerea parametrilor de referință pentru volumul de lucru agentic, cum ar fi SemiAnalysis AgentX, semnalează o schimbare în modul în care este măsurată performanța AI. Pe măsură ce sistemele AI trec de la răspunsuri într-o singură tură la raționament și acțiune în mai mulți pași, este posibil ca valorile tradiționale ale debitului să nu capteze pe deplin utilitatea. Îmbunătățirea performanței de 30 ori în acest domeniu specific indică faptul că hardware-ul de ultimă generație este optimizat în mod special pentru cerințele de latență și de calcul ale AI agentic, care este un sector în creștere în aplicațiile pentru întreprinderi.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
Which component of an AI application is the machine-learning model itself?
Ce să urmărești în continuare
Monitorizați verificarea finală a acestor rezultate de către MLCommons și lansarea ulterioară a platformei Vera Rubin pe piață. În plus, urmăriți adoptarea noului punct de referință MLPerf Endpoints pentru inferența agentică, care va standardiza valorile de performanță pentru agenții AI în mai mulți pași și va observa modul în care concurenții răspund la aceste benchmark-uri specifice de debit și eficiență de scalare.
Verificarea finală a acestor rezultate previzualizării de către MLCommons este următorul pas imediat. Până la verificare, aceste numere sunt preliminare și pot fi modificate. Lansarea oficială va oferi linia de bază definitivă a performanței pentru platforma Vera Rubin.
Disponibilitatea pe piață și prețurile platformei Vera Rubin NVL72 vor determina impactul său practic. În timp ce câștigurile de performanță sunt documentate, costul hardware-ului și perioada de tranziție de la GB300 vor influența ratele de adoptare. Organizațiile vor trebui să cântărească beneficiile de performanță în raport cu cheltuielile de capital necesare pentru modernizare.
Dezvoltarea și adoptarea benchmark-ului MLPerf Endpoints pentru inferența agentică va fi crucială. Pe măsură ce acest punct de referință devine standardizat, va oferi o imagine mai cuprinzătoare a capacităților sistemului AI dincolo de debitul de token brut, remodulând eventual modul în care vânzătorii își comercializează și își compară platformele.