Apa yang terjadi
NVIDIA mengirimkan data kinerja pratinjau untuk platform Vera Rubin NVL72 ke rangkaian benchmark MLPerf v6.1, yang menunjukkan peningkatan throughput yang signifikan dibandingkan GB300 NVL72 generasi sebelumnya. Hasilnya menunjukkan throughput hingga 3,7x lebih tinggi pada benchmark Qwen3-VL dan throughput 2,5x lebih tinggi pada DeepSeek-R1, didorong oleh desain bersama perangkat keras-perangkat lunak, presisi NVFP4, dan teknik penyajian terpilah.
NVIDIA merilis hasil pratinjau untuk platform Vera Rubin NVL72 di suite MLPerf v6.1, dengan fokus pada benchmark DeepSeek-R1 dan Qwen3-VL. Perusahaan melaporkan bahwa Vera Rubin NVL72 memberikan throughput hingga 3,7x lebih tinggi dibandingkan GB300 NVL72 pada Qwen3-VL di seluruh skenario offline, server, dan interaktif saat menggunakan vLLM dengan kerangka inferensi sumber terbuka NVIDIA Dynamo. Untuk benchmark DeepSeek-R1, yang menggunakan pustaka NVIDIA TensorRT-LLM, throughputnya mencapai 2,5x lebih tinggi dibandingkan GB300 NVL72.
Peningkatan performa ini disebabkan oleh desain bersama full-stack, termasuk Tensor Cores yang ditingkatkan, Transformer Engine, dan presisi NVFP4, yang mengurangi jejak memori untuk bobot model, perhatian, dan cache KV. Pengiriman tersebut banyak menggunakan penyajian terpilah, memisahkan tahap pra-pengisian dan dekode, serta paralelisme pakar skala besar untuk lapisan campuran pakar. Domain peningkatan NVL72, yang didukung oleh NVLink dan NVLink Switch generasi keenam, memberikan landasan interkoneksi yang diperlukan untuk teknik ini pada skala rak.
NVIDIA juga menyoroti efisiensi penskalaan, mengingat bahwa pengiriman DeepSeek-R1 ditingkatkan dari satu rak GB300 NVL72 menjadi empat rak (288 GPU) dengan efisiensi penskalaan 99% dalam skenario offline. Dalam beban kerja agen, khususnya benchmark SemiAnalysis AgentX, Vera Rubin NVL72 memberikan kinerja 30x lebih baik dibandingkan GB300 NVL72 dalam pengujian pratinjau. Mitra Nebius juga mengirimkan hasil pratinjau Vera Rubin NVL72, yang menunjukkan karakteristik kinerja serupa.
Rilis ini mencakup hasil dari ekosistem NVIDIA yang lebih luas, dengan 19 mitra mengirimkan data, termasuk ASUS, Azure, Cisco, CoreWeave, dan Oracle Cloud Infrastructure. NVIDIA juga mengirimkan hasil Jetson AGX Thor menggunakan TensorRT Edge-LLM pada benchmark Edge-Agentic baru dengan Qwen3.6-27B. Hasil pasca-pengajuan untuk GPT-OSS-120B dan DLRMv3 menunjukkan peningkatan lebih lanjut tetapi belum diverifikasi oleh MLCommons.
Detail sumber: blogs.nvidia.com ↗
Mengapa itu penting
Hasil ini memberikan bukti nyata mengenai lintasan kinerja infrastruktur inferensi AI generasi mendatang, yang secara langsung berdampak pada penghematan biaya per token bagi organisasi yang menerapkan model bahasa berukuran besar. Dengan menunjukkan efisiensi penskalaan yang hampir linier di berbagai rak dan peningkatan besar dalam beban kerja agen, data ini membantu perusahaan memperkirakan kebutuhan infrastruktur dan memvalidasi kelayakan ekonomi dari penskalaan penerapan AI. Hal ini penting karena biaya inferensi merupakan pendorong utama profitabilitas dan aksesibilitas produk AI.
Signifikansi utama dari hasil ini terletak pada kuantifikasi ilmu ekonomi inferensi. Dengan menunjukkan bahwa setiap rak Vera Rubin NVL72 dapat menghasilkan lebih banyak token secara signifikan dan melayani lebih banyak pengguna dibandingkan rak GB300 NVL72, NVIDIA memberikan metrik yang jelas untuk pengurangan biaya per token. Hal ini penting bagi organisasi yang biaya inferensinya merupakan bagian terbesar dari biaya operasional, karena hal ini secara langsung berarti potensi pendapatan yang lebih tinggi atau biaya layanan yang lebih rendah untuk beban kerja yang sama.
Penekanan pada efisiensi penskalaan mengatasi masalah umum dalam infrastruktur AI: hubungan non-linier antara penambahan perangkat keras dan peningkatan throughput. Pencapaian efisiensi penskalaan sebesar 99% di 288 GPU menunjukkan bahwa arsitektur dan interkoneksi secara efektif memitigasi hambatan komunikasi, memungkinkan organisasi memprediksi peningkatan kinerja dengan lebih akurat saat memperluas pabrik AI mereka.
Dimasukkannya tolok ukur beban kerja agen, seperti SemiAnalysis AgentX, menandakan perubahan dalam cara pengukuran kinerja AI. Ketika sistem AI beralih dari respons satu putaran ke penalaran dan tindakan multi-langkah, metrik throughput tradisional mungkin tidak sepenuhnya menangkap manfaatnya. Peningkatan kinerja sebesar 30x dalam domain spesifik ini menunjukkan bahwa perangkat keras generasi berikutnya secara khusus dioptimalkan untuk latensi dan tuntutan komputasi AI agen, yang merupakan sektor yang sedang berkembang dalam aplikasi perusahaan.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Pantau verifikasi akhir hasil ini oleh MLCommons dan peluncuran platform Vera Rubin selanjutnya ke pasar. Selain itu, lacak penerapan tolok ukur MLPerf Endpoints baru untuk inferensi agen, yang akan menstandardisasi metrik kinerja untuk agen AI multi-langkah, dan amati bagaimana pesaing merespons tolok ukur efisiensi throughput dan penskalaan spesifik ini.
Verifikasi akhir hasil pratinjau ini oleh MLCommons adalah langkah berikutnya. Hingga diverifikasi, angka-angka ini masih bersifat sementara dan dapat berubah. Rilis resmi ini akan memberikan dasar kinerja definitif untuk platform Vera Rubin.
Ketersediaan pasar dan harga platform Vera Rubin NVL72 akan menentukan dampak praktisnya. Meskipun peningkatan kinerja telah didokumentasikan, biaya perangkat keras dan periode transisi dari GB300 akan memengaruhi tingkat adopsi. Organisasi perlu mempertimbangkan manfaat kinerja dibandingkan belanja modal yang diperlukan untuk peningkatan tersebut.
Pengembangan dan penerapan tolok ukur MLPerf Endpoints untuk inferensi agen akan menjadi hal yang sangat penting. Ketika tolok ukur ini menjadi terstandarisasi, hal ini akan memberikan pandangan yang lebih komprehensif tentang kemampuan sistem AI di luar throughput token mentah, sehingga berpotensi membentuk kembali cara vendor memasarkan dan membandingkan platform mereka.