العودة إلى الأخبار
الابتكارAI Understanding إحاطة

تنشر NVIDIA Vera Rubin NVL72 نتائج MLPerf Inference v6.1 الرائدة

أصدرت NVIDIA نتائج معاينة توضح أن Vera Rubin NVL72 تحقق إنتاجية أعلى بما يصل إلى 3.7 مرة من GB300 NVL72 على Qwen3-VL و2.5x على DeepSeek-R1 في مجموعة MLPerf Inference v6.1.

4 min readRead the primary source
Source-provided image accompanying NVIDIA Vera Rubin NVL72 posts leading MLPerf Inference v6.1 results
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
blogs.nvidia.com
رابط المصدر
blogs.nvidia.comhttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

الاستدلال
مرحلة وقت التشغيل حيث يقوم النموذج المدرب بإنشاء تنبؤات أو مخرجات.
نموذج اللغة الكبير (LLM)
نموذج لغة تم تدريبه على مجموعات نصية ضخمة لإنشاء النص وتحليله.
الذاكرة (ذاكرة الوكيل)
السياق المُخزن الذي يستخدمه وكيل الذكاء الاصطناعي عبر الخطوات أو الجلسات لتحسين الاستمرارية.
اختبر نفسكوأوضح نماذج الذكاء الاصطناعي مسابقة

ماذا حدث

قدمت NVIDIA بيانات أداء معاينة لمنصة Vera Rubin NVL72 الخاصة بها إلى مجموعة معايير MLPerf v6.1، مما يدل على تحسينات كبيرة في الإنتاجية مقارنة بالجيل السابق GB300 NVL72. تشير النتائج إلى إنتاجية أعلى بما يصل إلى 3.7 مرة على معيار Qwen3-VL وإنتاجية أعلى بمقدار 2.5 مرة على DeepSeek-R1، مدفوعة بالتصميم المشترك للأجهزة والبرمجيات، ودقة NVFP4، وتقنيات التقديم المفصلة.

أصدرت NVIDIA نتائج معاينة لمنصة Vera Rubin NVL72 في مجموعة MLPerf v6.1، مع التركيز على معايير DeepSeek-R1 وQwen3-VL. ذكرت الشركة أن Vera Rubin NVL72 توفر إنتاجية أعلى بما يصل إلى 3.7 مرة من GB300 NVL72 على Qwen3-VL عبر السيناريوهات غير المتصلة بالإنترنت والخادم والسيناريوهات التفاعلية عند استخدام vLLM مع إطار عمل الاستدلال مفتوح المصدر NVIDIA Dynamo. بالنسبة لمعيار DeepSeek-R1، باستخدام مكتبة NVIDIA TensorRT-LLM، كانت الإنتاجية أعلى بما يصل إلى 2.5 مرة من GB300 NVL72.

تُعزى مكاسب الأداء إلى التصميم المشترك الكامل، بما في ذلك Tensor Cores، وTransformer Engine، ودقة NVFP4، مما يقلل من أثر الذاكرة لأوزان النماذج، والانتباه، وذاكرة التخزين المؤقت KV. استخدمت التقديمات بشكل كبير الخدمة المفصلة، ​​وفصل مراحل التعبئة المسبقة وفك التشفير، جنبًا إلى جنب مع التوازي الخبراء واسع النطاق لطبقات خليط الخبراء. يوفر مجال التوسعة NVL72، المدعوم بالجيل السادس من NVLink وNVLink Switch، أساس الاتصال البيني اللازم لهذه التقنيات على نطاق الحامل.

كما سلطت NVIDIA الضوء على كفاءة التوسع، مع الإشارة إلى أن تقديم DeepSeek-R1 قد تم توسيعه من حامل GB300 NVL72 واحد إلى أربعة رفوف (288 وحدة معالجة رسومات) مع كفاءة توسيع بنسبة 99% في السيناريو غير المتصل بالإنترنت. في أعباء العمل الوكيلة، وتحديدًا اختبار SemiAnalogy AgentX، قدمت Vera Rubin NVL72 أداءً أفضل 30 مرة من GB300 NVL72 في اختبار المعاينة. أرسل الشريك Nebius أيضًا نتائج معاينة Vera Rubin NVL72، مما يدل على خصائص أداء مماثلة.

يتضمن الإصدار نتائج من النظام البيئي الأوسع NVIDIA، مع 19 شريكًا يقدمون البيانات، بما في ذلك ASUS، وAzure، وCisco، وCoreWeave، وOracle Cloud Infrastructure. قدمت NVIDIA أيضًا نتائج Jetson AGX Thor باستخدام TensorRT Edge-LLM على معيار Edge-Agentic الجديد مع Qwen3.6-27B. أظهرت نتائج ما بعد التقديم لـ GPT-OSS-120B وDLRMv3 المزيد من المكاسب ولكن لم يتم التحقق منها بعد بواسطة MLCommons.

تفاصيل المصدر: blogs.nvidia.com ↗

لماذا يهم

توفر هذه النتائج دليلاً ملموسًا على مسار أداء الجيل التالي من البنية التحتية لاستدلال الذكاء الاصطناعي، مما يؤثر بشكل مباشر على اقتصاديات التكلفة لكل رمز مميز للمؤسسات التي تنشر نماذج لغوية كبيرة. من خلال إظهار كفاءة التوسع شبه الخطي عبر رفوف متعددة ومكاسب كبيرة في أعباء العمل الوكيل، تساعد البيانات المؤسسات على التنبؤ بمتطلبات البنية التحتية والتحقق من الجدوى الاقتصادية لتوسيع نطاق عمليات نشر الذكاء الاصطناعي. وهذا مهم لأن تكاليف الاستدلال هي المحرك الأساسي لربحية منتج الذكاء الاصطناعي وإمكانية الوصول إليه.

تكمن الأهمية الأساسية لهذه النتائج في القياس الكمي لاقتصاديات الاستدلال. من خلال إثبات أن كل حامل Vera Rubin NVL72 يمكنه إنشاء عدد أكبر بكثير من الرموز المميزة وخدمة عدد أكبر من المستخدمين مقارنة بحامل GB300 NVL72، يوفر NVIDIA مقياسًا واضحًا لتقليل التكلفة لكل رمز مميز. يعد هذا أمرًا بالغ الأهمية للمؤسسات حيث تشكل تكاليف الاستدلال جزءًا كبيرًا من النفقات التشغيلية، حيث أنها تترجم مباشرة إلى زيادة الإيرادات المحتملة أو انخفاض تكاليف الخدمة لنفس عبء العمل.

يعالج التركيز على كفاءة التوسع نقطة الألم الشائعة في البنية التحتية للذكاء الاصطناعي: العلاقة غير الخطية بين إضافة الأجهزة ومكاسب الإنتاجية. يشير تحقيق كفاءة التوسع بنسبة 99% عبر 288 وحدة معالجة رسوميات إلى أن البنية والوصلات البينية تخفف بشكل فعال من اختناقات الاتصالات، مما يسمح للمؤسسات بالتنبؤ بمكاسب الأداء بشكل أكثر دقة عند توسيع مصانع الذكاء الاصطناعي الخاصة بها.

يشير تضمين معايير عبء العمل الوكيل، مثل SemiAnalogy AgentX، إلى حدوث تحول في كيفية قياس أداء الذكاء الاصطناعي. مع انتقال أنظمة الذكاء الاصطناعي من الاستجابات أحادية المنعطف إلى التفكير والعمل متعدد الخطوات، فإن مقاييس الإنتاجية التقليدية قد لا تلتقط المنفعة بشكل كامل. يشير التحسن في الأداء بمقدار 30 مرة في هذا المجال المحدد إلى أن أجهزة الجيل التالي تم تحسينها خصيصًا لتلبية زمن الوصول ومتطلبات الحوسبة للذكاء الاصطناعي الوكيل، وهو قطاع متنامي في تطبيقات المؤسسات.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
التحقق من المفهوم التفاعلي+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ماذا تشاهد بعد ذلك

مراقبة التحقق النهائي من هذه النتائج بواسطة MLCommons والإصدار اللاحق لمنصة Vera Rubin في السوق. بالإضافة إلى ذلك، تتبع اعتماد معيار MLPerf Endpoints الجديد للاستدلال الوكيل، والذي سيوحد مقاييس الأداء لوكلاء الذكاء الاصطناعي متعدد الخطوات، ويلاحظ كيفية استجابة المنافسين لهذه الإنتاجية المحددة ومعايير كفاءة التوسع.

إن التحقق النهائي من نتائج المعاينة هذه بواسطة MLCommons هو الخطوة التالية المباشرة. وإلى أن يتم التحقق منها، فإن هذه الأرقام أولية وقابلة للتغيير. سيوفر الإصدار الرسمي خط الأساس للأداء النهائي لمنصة Vera Rubin.

سيحدد مدى توفر منصة Vera Rubin NVL72 وأسعارها في السوق تأثيرها العملي. وبينما يتم توثيق مكاسب الأداء، فإن تكلفة الأجهزة والفترة الانتقالية من GB300 ستؤثر على معدلات الاعتماد. ستحتاج المؤسسات إلى الموازنة بين فوائد الأداء والنفقات الرأسمالية المطلوبة للترقية.

سيكون تطوير واعتماد معيار MLPerf Endpoints للاستدلال الوكيل أمرًا بالغ الأهمية. ومع توحيد هذا المعيار، فإنه سيوفر رؤية أكثر شمولاً لقدرات نظام الذكاء الاصطناعي بما يتجاوز إنتاجية الرمز المميز الخام، مما قد يعيد تشكيل كيفية قيام البائعين بتسويق منصاتهم ومقارنتها.

الأدلة والاختبارات ذات الصلة

شرح نماذج الذكاء الاصطناعيتدريب الذكاء الاصطناعيمستقبل الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟