Kembali ke Berita
InovasiAI Understanding pengarahan

NVIDIA Vera Rubin NVL72 memposting hasil MLPerf Inference v6.1 terkemuka

NVIDIA merilis hasil pratinjau yang menunjukkan Vera Rubin NVL72 mencapai throughput hingga 3,7x lebih tinggi dibandingkan GB300 NVL72 pada Qwen3-VL dan 2,5x pada DeepSeek-R1 di rangkaian MLPerf Inference v6.1.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
Dokumen sumber utamaSumber direkam
Penerbit
blogs.nvidia.com
Tautan sumber
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Kesimpulan
Fase runtime saat model terlatih menghasilkan prediksi atau keluaran.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih pada corpora teks besar untuk menghasilkan dan menganalisis teks.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang terjadi

NVIDIA mengirimkan data kinerja pratinjau untuk platform Vera Rubin NVL72 ke rangkaian benchmark MLPerf v6.1, yang menunjukkan peningkatan throughput yang signifikan dibandingkan GB300 NVL72 generasi sebelumnya. Hasilnya menunjukkan throughput hingga 3,7x lebih tinggi pada benchmark Qwen3-VL dan throughput 2,5x lebih tinggi pada DeepSeek-R1, didorong oleh desain bersama perangkat keras-perangkat lunak, presisi NVFP4, dan teknik penyajian terpilah.

NVIDIA merilis hasil pratinjau untuk platform Vera Rubin NVL72 di suite MLPerf v6.1, dengan fokus pada benchmark DeepSeek-R1 dan Qwen3-VL. Perusahaan melaporkan bahwa Vera Rubin NVL72 memberikan throughput hingga 3,7x lebih tinggi dibandingkan GB300 NVL72 pada Qwen3-VL di seluruh skenario offline, server, dan interaktif saat menggunakan vLLM dengan kerangka inferensi sumber terbuka NVIDIA Dynamo. Untuk benchmark DeepSeek-R1, yang menggunakan pustaka NVIDIA TensorRT-LLM, throughputnya mencapai 2,5x lebih tinggi dibandingkan GB300 NVL72.

Peningkatan performa ini disebabkan oleh desain bersama full-stack, termasuk Tensor Cores yang ditingkatkan, Transformer Engine, dan presisi NVFP4, yang mengurangi jejak memori untuk bobot model, perhatian, dan cache KV. Pengiriman tersebut banyak menggunakan penyajian terpilah, memisahkan tahap pra-pengisian dan dekode, serta paralelisme pakar skala besar untuk lapisan campuran pakar. Domain peningkatan NVL72, yang didukung oleh NVLink dan NVLink Switch generasi keenam, memberikan landasan interkoneksi yang diperlukan untuk teknik ini pada skala rak.

NVIDIA juga menyoroti efisiensi penskalaan, mengingat bahwa pengiriman DeepSeek-R1 ditingkatkan dari satu rak GB300 NVL72 menjadi empat rak (288 GPU) dengan efisiensi penskalaan 99% dalam skenario offline. Dalam beban kerja agen, khususnya benchmark SemiAnalysis AgentX, Vera Rubin NVL72 memberikan kinerja 30x lebih baik dibandingkan GB300 NVL72 dalam pengujian pratinjau. Mitra Nebius juga mengirimkan hasil pratinjau Vera Rubin NVL72, yang menunjukkan karakteristik kinerja serupa.

Rilis ini mencakup hasil dari ekosistem NVIDIA yang lebih luas, dengan 19 mitra mengirimkan data, termasuk ASUS, Azure, Cisco, CoreWeave, dan Oracle Cloud Infrastructure. NVIDIA juga mengirimkan hasil Jetson AGX Thor menggunakan TensorRT Edge-LLM pada benchmark Edge-Agentic baru dengan Qwen3.6-27B. Hasil pasca-pengajuan untuk GPT-OSS-120B dan DLRMv3 menunjukkan peningkatan lebih lanjut tetapi belum diverifikasi oleh MLCommons.

Detail sumber: blogs.nvidia.com ↗

Mengapa itu penting

Hasil ini memberikan bukti nyata mengenai lintasan kinerja infrastruktur inferensi AI generasi mendatang, yang secara langsung berdampak pada penghematan biaya per token bagi organisasi yang menerapkan model bahasa berukuran besar. Dengan menunjukkan efisiensi penskalaan yang hampir linier di berbagai rak dan peningkatan besar dalam beban kerja agen, data ini membantu perusahaan memperkirakan kebutuhan infrastruktur dan memvalidasi kelayakan ekonomi dari penskalaan penerapan AI. Hal ini penting karena biaya inferensi merupakan pendorong utama profitabilitas dan aksesibilitas produk AI.

Signifikansi utama dari hasil ini terletak pada kuantifikasi ilmu ekonomi inferensi. Dengan menunjukkan bahwa setiap rak Vera Rubin NVL72 dapat menghasilkan lebih banyak token secara signifikan dan melayani lebih banyak pengguna dibandingkan rak GB300 NVL72, NVIDIA memberikan metrik yang jelas untuk pengurangan biaya per token. Hal ini penting bagi organisasi yang biaya inferensinya merupakan bagian terbesar dari biaya operasional, karena hal ini secara langsung berarti potensi pendapatan yang lebih tinggi atau biaya layanan yang lebih rendah untuk beban kerja yang sama.

Penekanan pada efisiensi penskalaan mengatasi masalah umum dalam infrastruktur AI: hubungan non-linier antara penambahan perangkat keras dan peningkatan throughput. Pencapaian efisiensi penskalaan sebesar 99% di 288 GPU menunjukkan bahwa arsitektur dan interkoneksi secara efektif memitigasi hambatan komunikasi, memungkinkan organisasi memprediksi peningkatan kinerja dengan lebih akurat saat memperluas pabrik AI mereka.

Dimasukkannya tolok ukur beban kerja agen, seperti SemiAnalysis AgentX, menandakan perubahan dalam cara pengukuran kinerja AI. Ketika sistem AI beralih dari respons satu putaran ke penalaran dan tindakan multi-langkah, metrik throughput tradisional mungkin tidak sepenuhnya menangkap manfaatnya. Peningkatan kinerja sebesar 30x dalam domain spesifik ini menunjukkan bahwa perangkat keras generasi berikutnya secara khusus dioptimalkan untuk latensi dan tuntutan komputasi AI agen, yang merupakan sektor yang sedang berkembang dalam aplikasi perusahaan.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

Pantau verifikasi akhir hasil ini oleh MLCommons dan peluncuran platform Vera Rubin selanjutnya ke pasar. Selain itu, lacak penerapan tolok ukur MLPerf Endpoints baru untuk inferensi agen, yang akan menstandardisasi metrik kinerja untuk agen AI multi-langkah, dan amati bagaimana pesaing merespons tolok ukur efisiensi throughput dan penskalaan spesifik ini.

Verifikasi akhir hasil pratinjau ini oleh MLCommons adalah langkah berikutnya. Hingga diverifikasi, angka-angka ini masih bersifat sementara dan dapat berubah. Rilis resmi ini akan memberikan dasar kinerja definitif untuk platform Vera Rubin.

Ketersediaan pasar dan harga platform Vera Rubin NVL72 akan menentukan dampak praktisnya. Meskipun peningkatan kinerja telah didokumentasikan, biaya perangkat keras dan periode transisi dari GB300 akan memengaruhi tingkat adopsi. Organisasi perlu mempertimbangkan manfaat kinerja dibandingkan belanja modal yang diperlukan untuk peningkatan tersebut.

Pengembangan dan penerapan tolok ukur MLPerf Endpoints untuk inferensi agen akan menjadi hal yang sangat penting. Ketika tolok ukur ini menjadi terstandarisasi, hal ini akan memberikan pandangan yang lebih komprehensif tentang kemampuan sistem AI di luar throughput token mentah, sehingga berpotensi membentuk kembali cara vendor memasarkan dan membandingkan platform mereka.

Panduan & kuis terkait

Model AI DijelaskanPelatihan AIMasa Depan AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?