Nini kilitokea
NVIDIA iliwasilisha data ya onyesho la kuchungulia la utendakazi wa jukwaa lake la Vera Rubin NVL72 kwenye benchmark ya MLPerf v6.1, kuonyesha uboreshaji mkubwa wa matokeo ya kizazi kilichopita GB300 NVL72. Matokeo yanaonyesha hadi 3.7x upitishaji wa juu kwenye benchmark ya Qwen3-VL na 2.5x ya juu zaidi ya upitishaji kwenye DeepSeek-R1, inayoendeshwa na muundo-shirikishi wa programu-jalizi, usahihi wa NVFP4, na mbinu za utoaji zilizogawanywa.
NVIDIA ilitoa matokeo ya onyesho la kuchungulia la jukwaa la Vera Rubin NVL72 katika Suite ya MLPerf v6.1, ikilenga alama za DeepSeek-R1 na Qwen3-VL. Kampuni hiyo iliripoti kuwa Vera Rubin NVL72 hutoa hadi 3.7x uboreshaji wa juu zaidi kuliko GB300 NVL72 kwenye Qwen3-VL katika hali ya nje ya mtandao, seva, na mwingiliano inapotumia vLLM na mfumo wa maelekezo wa chanzo huria wa NVIDIA Dynamo. Kwa kiwango cha DeepSeek-R1, kwa kutumia maktaba ya NVIDIA TensorRT-LLM, upitishaji ulikuwa hadi mara 2.5 juu kuliko GB300 NVL72.
Mafanikio ya utendaji yanachangiwa na muundo-shirikishi wa safu kamili, ikijumuisha Mihimili ya Tensor iliyoimarishwa, Injini ya Kibadilishaji na usahihi wa NVFP4, ambayo hupunguza alama ya kumbukumbu kwa uzani wa mfano, umakini, na kashe ya KV. Mawasilisho yametumika kwa kiasi kikubwa utoaji uliogawanywa, kutenganisha hatua za kujaza mapema na kusimbua, pamoja na uwiano mkubwa wa kitaalamu kwa tabaka za mchanganyiko wa wataalamu. Kikoa cha kuongeza kiwango cha NVL72, kinachoendeshwa na NVLink ya kizazi cha sita na NVLink Switch, kilitoa msingi wa muunganisho unaohitajika kwa mbinu hizi kwa kiwango cha rack.
NVIDIA pia iliangazia ufanisi wa kuongeza alama, ikibainisha kuwa uwasilishaji wa DeepSeek-R1 ulipunguzwa kutoka raki moja ya GB300 NVL72 hadi raki nne (GPU 288) kwa ufanisi wa 99% wa kuongeza kiwango katika hali ya nje ya mtandao. Katika mzigo wa kazi wa mawakala, haswa alama ya wakala wa SemiAnalysis, Vera Rubin NVL72 ilitoa utendakazi bora mara 30 kuliko GB300 NVL72 katika jaribio la kuchungulia. Mshirika Nebius pia aliwasilisha matokeo ya onyesho la kukagua Vera Rubin NVL72, yanayoonyesha sifa sawa za utendakazi.
Toleo hili linajumuisha matokeo kutoka kwa mfumo mpana wa ikolojia wa NVIDIA, na washirika 19 wanaowasilisha data, ikiwa ni pamoja na ASUS, Azure, Cisco, CoreWeave, na Oracle Cloud Infrastructure. NVIDIA pia iliwasilisha matokeo ya Jetson AGX Thor kwa kutumia TensorRT Edge-LLM kwenye kigezo kipya cha Edge-Agentic na Qwen3.6-27B. Matokeo ya uwasilishaji baada ya GPT-OSS-120B na DLRMv3 yalionyesha mafanikio zaidi lakini bado hayajathibitishwa na MLCommons.
Maelezo ya chanzo: blogs.nvidia.com ↗
Kwa nini ni muhimu
Matokeo haya yanatoa ushahidi thabiti wa mwelekeo wa utendaji wa miundombinu ya maelekezo ya AI ya kizazi kijacho, inayoathiri moja kwa moja uchumi wa gharama kwa kila tokeni kwa mashirika yanayotumia miundo mikubwa ya lugha. Kwa kuonyesha ufanisi wa karibu wa kuongeza viwango kwenye rafu nyingi na faida kubwa katika mzigo wa kazi wa mawakala, data husaidia utabiri wa mahitaji ya miundombinu ya biashara na kuthibitisha uwezekano wa kiuchumi wa kuongeza uwekaji wa AI. Hii ni muhimu kwa sababu gharama za uelekezaji ndio kichocheo kikuu cha faida na ufikiaji wa bidhaa za AI.
Umuhimu mkuu wa matokeo haya uko katika ujanibishaji wa uchumi wa uelekezaji. Kwa kuonyesha kwamba kila rack ya Vera Rubin NVL72 inaweza kutoa tokeni nyingi zaidi na kutumikia watumiaji zaidi ya rack ya GB300 NVL72, NVIDIA hutoa metriki wazi kwa kupunguza gharama kwa kila tokeni. Hili ni muhimu kwa mashirika ambapo gharama za makisio zinajumuisha sehemu kubwa ya gharama za uendeshaji, kwani hutafsiri moja kwa moja kwa uwezo wa juu wa mapato au gharama za chini za huduma kwa mzigo sawa wa kazi.
Msisitizo wa kuongeza ufanisi hushughulikia sehemu ya maumivu ya kawaida katika miundombinu ya AI: uhusiano usio na mstari kati ya nyongeza ya maunzi na mafanikio ya upitishaji. Kufikia 99% ya ufanisi wa kuongeza kwenye GPU 288 kunapendekeza kwamba usanifu na miunganisho inapunguza vyema vikwazo vya mawasiliano, kuruhusu mashirika kutabiri faida za utendaji kwa usahihi zaidi wakati wa kupanua viwanda vyao vya AI.
Ujumuishaji wa vigezo vya mzigo wa kazi wa mawakala, kama vile SemiAnalysis AgentX, huashiria mabadiliko katika jinsi utendaji wa AI unavyopimwa. Mifumo ya AI inapohama kutoka kwa majibu ya zamu moja hadi hoja ya hatua nyingi na hatua, vipimo vya kawaida vya upitishaji vinaweza kutonasa matumizi kikamilifu. Uboreshaji wa utendakazi wa mara 30 katika kikoa hiki mahususi unaonyesha kuwa maunzi ya kizazi kijacho yameboreshwa mahususi kwa muda wa kusubiri na kukokotoa mahitaji ya wakala wa AI, ambayo ni sekta inayokua katika matumizi ya biashara.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Fuatilia uthibitishaji wa mwisho wa matokeo haya na MLCommons na kutolewa kwa mfumo wa Vera Rubin sokoni. Zaidi ya hayo, fuatilia kupitishwa kwa benchmark mpya ya MlPerf Endpoints kwa uelekezaji wa mawakala, ambayo itasanifisha vipimo vya utendaji kwa mawakala wa hatua nyingi wa AI, na uangalie jinsi washindani wanavyoitikia vigezo hivi mahususi vya upitishaji na kuongeza viwango vya ufanisi.
Uthibitishaji wa mwisho wa matokeo haya ya onyesho la kukagua na MLCommons ni hatua inayofuata ya haraka. Hadi zitakapothibitishwa, nambari hizi ni za awali na zinaweza kubadilika. Toleo rasmi litatoa msingi mahususi wa utendakazi wa jukwaa la Vera Rubin.
Upatikanaji wa soko na bei ya jukwaa la Vera Rubin NVL72 itaamua athari yake ya vitendo. Ingawa faida za utendakazi zimeandikwa, gharama ya maunzi na kipindi cha mpito kutoka GB300 kitaathiri viwango vya kupitishwa. Mashirika yatahitaji kupima manufaa ya utendakazi dhidi ya matumizi ya mtaji yanayohitajika kwa ajili ya kuboresha.
Uundaji na upitishaji wa alama za mwisho za MPerf kwa uelekezaji wa mawakala itakuwa muhimu. Kadiri alama hii inavyosawazishwa, itatoa mwonekano mpana zaidi wa uwezo wa mfumo wa AI zaidi ya upitishaji wa tokeni ghafi, uwezekano wa kubadilisha jinsi wachuuzi wanavyouza na kulinganisha majukwaa yao.