Apa yang berlaku
NVIDIA menyerahkan data prestasi pratonton untuk platform Vera Rubin NVL72nya kepada suite penanda aras MLPerf v6.1, menunjukkan peningkatan daya pengeluaran yang ketara berbanding GB300 NVL72 generasi sebelumnya. Hasilnya menunjukkan daya pemprosesan sehingga 3.7x lebih tinggi pada penanda aras Qwen3-VL dan daya pemprosesan 2.5x lebih tinggi pada DeepSeek-R1, didorong oleh reka bentuk bersama perisian perkakasan, ketepatan NVFP4 dan teknik penyajian diagregatkan.
NVIDIA mengeluarkan hasil pratonton untuk platform Vera Rubin NVL72 dalam suite MLPerf v6.1, memfokuskan pada penanda aras DeepSeek-R1 dan Qwen3-VL. Syarikat itu melaporkan bahawa Vera Rubin NVL72 memberikan daya pemprosesan sehingga 3.7x lebih tinggi daripada GB300 NVL72 pada Qwen3-VL merentas senario luar talian, pelayan dan interaktif apabila menggunakan vLLM dengan rangka kerja inferens sumber terbuka NVIDIA Dynamo. Untuk penanda aras DeepSeek-R1, menggunakan perpustakaan NVIDIA TensorRT-LLM, daya pemprosesan adalah sehingga 2.5x lebih tinggi daripada GB300 NVL72.
Peningkatan prestasi dikaitkan dengan reka bentuk bersama timbunan penuh, termasuk Teras Tensor yang dipertingkatkan, Enjin Transformer dan ketepatan NVFP4, yang mengurangkan jejak memori untuk berat model, perhatian dan cache KV. Penyerahan banyak menggunakan hidangan terpisah, memisahkan peringkat praisi dan penyahkod, bersama-sama dengan paralelisma pakar berskala besar untuk lapisan campuran pakar. Domain skala NVL72, dikuasakan oleh NVLink dan Suis NVLink generasi keenam, menyediakan asas interkoneksi yang diperlukan untuk teknik ini pada skala rak.
NVIDIA turut menyerlahkan kecekapan penskalaan, dengan menyatakan bahawa penyerahan DeepSeek-R1 berskala daripada rak GB300 NVL72 tunggal kepada empat rak (288 GPU) dengan kecekapan penskalaan 99% dalam senario luar talian. Dalam beban kerja agen, khususnya penanda aras SemiAnalysis AgentX, Vera Rubin NVL72 menyampaikan prestasi 30x lebih baik daripada GB300 NVL72 dalam ujian pratonton. Rakan kongsi Nebius juga menyerahkan keputusan pratonton Vera Rubin NVL72, menunjukkan ciri prestasi yang serupa.
Keluaran ini termasuk hasil daripada ekosistem NVIDIA yang lebih luas, dengan 19 rakan kongsi menyerahkan data, termasuk ASUS, Azure, Cisco, CoreWeave dan Oracle Cloud Infrastructure. NVIDIA juga menyerahkan keputusan Jetson AGX Thor menggunakan TensorRT Edge-LLM pada penanda aras Edge-Agentic baharu dengan Qwen3.6-27B. Keputusan pasca penyerahan untuk GPT-OSS-120B dan DLRMv3 menunjukkan peningkatan selanjutnya tetapi belum disahkan oleh MLCommons.
Butiran sumber: blogs.nvidia.com ↗
Mengapa ia penting
Keputusan ini memberikan bukti konkrit tentang trajektori prestasi untuk infrastruktur inferens AI generasi akan datang, secara langsung memberi kesan kepada ekonomi kos setiap token untuk organisasi yang menggunakan model bahasa yang besar. Dengan menunjukkan kecekapan penskalaan hampir linear merentas berbilang rak dan keuntungan besar dalam beban kerja agen, data membantu perusahaan meramalkan keperluan infrastruktur dan mengesahkan daya maju ekonomi untuk menskalakan penggunaan AI. Ini penting kerana kos inferens ialah pemacu utama keuntungan dan kebolehcapaian produk AI.
Kepentingan utama keputusan ini terletak pada kuantifikasi ekonomi inferens. Dengan menunjukkan bahawa setiap rak Vera Rubin NVL72 boleh menjana lebih banyak token dan memberi perkhidmatan kepada lebih ramai pengguna berbanding rak GB300 NVL72, NVIDIA menyediakan metrik yang jelas untuk pengurangan kos setiap token. Ini penting bagi organisasi yang kos inferens membentuk sebahagian besar perbelanjaan operasi, kerana ia secara langsung diterjemahkan kepada potensi hasil yang lebih tinggi atau kos perkhidmatan yang lebih rendah untuk beban kerja yang sama.
Penekanan pada kecekapan penskalaan menangani titik kesakitan yang biasa dalam infrastruktur AI: hubungan tidak linear antara penambahan perkakasan dan keuntungan pemprosesan. Mencapai kecekapan penskalaan 99% merentas 288 GPU menunjukkan bahawa seni bina dan sambung menyambung secara berkesan mengurangkan kesesakan komunikasi, membolehkan organisasi meramalkan peningkatan prestasi dengan lebih tepat apabila mengembangkan kilang AI mereka.
Kemasukan penanda aras beban kerja agen, seperti SemiAnalysis AgentX, menandakan peralihan dalam cara prestasi AI diukur. Apabila sistem AI beralih daripada respons satu pusingan kepada penaakulan dan tindakan berbilang langkah, metrik pemprosesan tradisional mungkin tidak menangkap utiliti sepenuhnya. Peningkatan prestasi 30x ganda dalam domain khusus ini menunjukkan bahawa perkakasan generasi akan datang dioptimumkan secara khusus untuk kependaman dan permintaan pengiraan AI agenik, yang merupakan sektor yang semakin berkembang dalam aplikasi perusahaan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Pantau pengesahan akhir keputusan ini oleh MLCommons dan keluaran seterusnya platform Vera Rubin ke pasaran. Selain itu, jejaki penggunaan penanda aras MLPerf Endpoints baharu untuk inferens agen, yang akan menyeragamkan metrik prestasi untuk ejen AI berbilang langkah, dan memerhatikan cara pesaing bertindak balas terhadap penanda aras daya pemprosesan dan penskalaan khusus ini.
Pengesahan akhir keputusan pratonton ini oleh MLCommons ialah langkah seterusnya yang segera. Sehingga disahkan, nombor ini adalah awal dan tertakluk kepada perubahan. Keluaran rasmi akan menyediakan garis dasar prestasi muktamad untuk platform Vera Rubin.
Ketersediaan pasaran dan harga platform Vera Rubin NVL72 akan menentukan kesan praktikalnya. Walaupun peningkatan prestasi didokumenkan, kos perkakasan dan tempoh peralihan daripada GB300 akan mempengaruhi kadar penggunaan. Organisasi perlu menimbang manfaat prestasi berbanding perbelanjaan modal yang diperlukan untuk peningkatan.
Pembangunan dan penggunaan penanda aras MLPerf Endpoints untuk inferens agen akan menjadi penting. Apabila penanda aras ini menjadi standard, ia akan memberikan pandangan yang lebih komprehensif tentang keupayaan sistem AI melangkaui daya pemprosesan token mentah, yang berpotensi membentuk semula cara vendor memasarkan dan membandingkan platform mereka.