ماذا حدث
نشرت OpenAI نتائج الاختبار الأولية لـ Jalapeño، وهي أول شريحة استدلال مخصصة لها. وتقول الشركة إن النظام قدم 1.5 إلى 1.9 مرة أكثر من عمل الذكاء الاصطناعي لكل واط عند ذروة الإنتاجية و1.7 إلى 3.6 مرة أقل من زمن الوصول من النهاية إلى النهاية مقارنة بالأنظمة المقارنة عبر GPT-OSS 120B وDeepSeek R1 670B وKimi K2.5 1T.
تقول OpenAI إن Jalapeño هي أول شريحة استدلال مخصصة لها وأن النتائج تعتمد على اختبار الشريحة مع النظام المبني حولها. قامت الشركة بتقييم النظام على InferenceX، وهو معيار معياري عام من SemiAnalogy يقيس العملية الكاملة لخدمة طلب الذكاء الاصطناعي. تقول OpenAI إنها قارنت Jalapeño بأنظمة الذكاء الاصطناعي المتاحة تجاريًا عبر نقاط تشغيل تتراوح من الخدمة عالية الإنتاجية إلى الاستخدام التفاعلي للغاية وزمن الوصول المنخفض.
عبر GPT-OSS 120B وDeepSeek R1 وKimi K2.5، سجلت OpenAI زيادة في عمل الذكاء الاصطناعي بمقدار 1.5 إلى 1.9 مرة لكل واط عند ذروة الإنتاجية و1.7 إلى 3.6 مرة أقل من زمن الوصول من النهاية إلى النهاية مقارنة بالأنظمة المقارنة. بالنسبة لأحمال العمل التفاعلية للغاية، يبلغ الأداء أعلى بمقدار 2.1 إلى 4.1 مرة. في الملحق، تقارن الشركة Jalapeño مع GB200 لـ GPT-OSS 120B ومع GB300 لـ DeepSeek R1 وKimi K2.5. تقول OpenAI إن Jalapeño وصلت إلى حدود باريتو عبر نقاط التشغيل التي تم اختبارها، مما يعني أنها وجدت مزيجًا أفضل من الإنتاجية وزمن الوصول وكفاءة الطاقة ضمن تلك المقارنات.
تفيد الشركة أن Jalapeño لديه تصنيف طاقة حزمة 700 واط، في حين بقيت الطاقة المستدامة المقاسة عند أو أقل من 550 واط في أحمال العمل التي تم اختبارها. تستخدم المقارنات المنشورة تصنيفات طاقة الحزمة، بما في ذلك 1200 واط لـ GB200 و1400 واط لـ GB300. بالنسبة لـ GPT-OSS 120B، أبلغت OpenAI عن ذروة الرموز المختلطة بحوالي 1.9 مرة في الثانية لكل كيلووات و1.7 مرة أقل من زمن الوصول من طرف إلى طرف مقارنة بنظام المقارنة. بالنسبة إلى DeepSeek R1، فإنه يُبلغ عن أداء أعلى بحوالي 1.7 مرة لكل واط وزمن وصول أقل بمقدار 3.6 مرة. بالنسبة إلى Kimi K2.5، فإنه يُبلغ عن أداء أعلى بحوالي 1.5 مرة لكل واط وزمن وصول أقل 3.4 مرة.
يعزو OpenAI النتائج إلى تصميم متكامل يجمع بين الشريحة والذاكرة والشبكة والبرامج ونظام مقياس الحامل حول أحمال عمل نموذج اللغة. تقول الشركة إن البنية تحافظ على حالة النموذج، بما في ذلك ذاكرة التخزين المؤقت KV المستخدمة أثناء الإنشاء، محليًا حيثما أمكن ذلك، وتقلل من تأخير الاتصال بين النوى والرقائق. ويصف الملء المسبق بأنه أكثر كثافة في الحوسبة وفك التشفير باعتباره أكثر تقييدًا بعرض النطاق الترددي للذاكرة، ويقول إن Jalapeño مصمم للتعامل مع كلتا المرحلتين. يقول OpenAI أيضًا إن الذكاء الاصطناعي ساعد في نقل الشريحة من التصميم الأولي إلى الشريط في تسعة أشهر وساعد في تحسين الدوائر الحسابية، لكن المصدر لا يقدم حسابًا مستقلاً لهذا الجدول الزمني أو تفصيلاً كاملاً لأعمال التصميم التي تمت آليًا.
لماذا يهم
تشير النتائج إلى أن أداء الاستدلال قد يعتمد بشكل متزايد على تصميم النماذج والرقائق والذاكرة والشبكات والبرمجيات كنظام واحد. إذا استمرت المكاسب على نطاق الإنتاج، فإنها يمكن أن تقلل من الطاقة والأجهزة اللازمة لخدمة استجابات الذكاء الاصطناعي وجعل أعباء عمل الوكلاء التفاعليين أكثر استجابة.
وتتمثل الأهمية المركزية في حدوث تحول محتمل في كيفية تحسين البنية التحتية للذكاء الاصطناعي. يجادل حساب OpenAI بأن المسرع للأغراض العامة يمكن أن يفقد الأداء عندما يتم التعامل مع الحساب والوصول إلى الذاكرة والاتصالات كمشكلات منفصلة. بدلاً من ذلك، يجمع Jalapeño هذه العناصر حول التوقيت وأنماط حركة البيانات لاستدلال نموذج اللغة. هذا النهج مهم لأن خدمة الاستجابة تتضمن معالجة الموجه وإنشاء الرموز المميزة بشكل تسلسلي، في حين أن الأنظمة الوكيلة قد تكرر هذه الخطوات عدة مرات في مهمة واحدة.
يمكن أن يكون لمكاسب زمن الوصول المُبلغ عنها تأثيرات عملية على منتجات الذكاء الاصطناعي التفاعلية إذا نجت من نشر الإنتاج. يقول OpenAI أن الاستدلال الأسرع يمكن أن يدعم وكلاء أكثر استجابة ويتيح إمكانية تشغيل أعباء عمل فائقة السرعة بكفاءات كانت مرتبطة سابقًا بأوضاع أسرع أو أكثر كثافة. ومع ذلك، لا يوضح المصدر هذه التأثيرات في منتج العميل المباشر. فهو يقدم نتائج مرجعية ونشرًا مخططًا للبنية التحتية، وبالتالي يظل التأثير العام محتملاً.
كفاءة الطاقة لها أيضا أهمية تشغيلية. تقول OpenAI أن إنتاج المزيد من العمل المفيد بنفس القوة والأجهزة يمكن أن يساعدها في تلبية الطلب بتكلفة أقل وتحسين الرافعة التشغيلية. يعد هذا الادعاء معقولاً كهدف تجاري، لكن المصدر لا يوفر تكاليف لكل استعلام، أو إجمالي تكاليف النظام، أو متطلبات التبريد، أو النفقات الرأسمالية، أو افتراضات الاستخدام أو الدليل على أن النسب المرجعية المبلغ عنها تترجم مباشرة إلى أسعار أقل للمستخدمين.
تعتبر عملية التطوير التي وصفها OpenAI بحد ذاتها جديرة بالملاحظة. وتقول الشركة إن نماذجها ساعدت في تصميم وإحضار جالابينو، في حين يتم استخدام النماذج الأحدث لتحسينه وبرمجته. باستخدام Codex مع GPT-Astra، ورد أن الفريق جلب ثلاثة نماذج ذات وزن مفتوح لم تكن جزءًا من خطة الإنتاج الأصلية إلى الأداء العالي في غضون شهرين. يقول OpenAI أيضًا أن التطبيقات التي تم إنشاؤها بواسطة الذكاء الاصطناعي كانت أسرع بمقدار 1.5 إلى 1.8 مرة من التطبيقات المكتوبة بواسطة الإنسان لاهتمام GPT-OSS المختار وكتل خليط الخبراء. تنطبق هذه الأرقام على كتل مختارة فقط، وليس على النماذج الكاملة، ولا تثبت أن الذكاء الاصطناعي يمكنه تصميم شريحة إنتاج كاملة أو تحسينها بشكل مستقل.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
تخطط OpenAI للبدء في نشر Jalapeño في البنية التحتية للحوسبة الخاصة بها بحلول نهاية عام 2026، لكنها تقول إن تأهيل الإنتاج ونضج البرامج وعمليات التوسع والتحقق من صحة النموذج على نطاق أوسع لا تزال جارية. لا يقوم المصدر بإنشاء تحقق مستقل أو تكلفة التشغيل أو حجم الإنتاج أو كيفية أداء الشريحة عبر أحمال العمل التي تتجاوز تلك التي تم اختبارها.
الاختبار الأول هو ما إذا كان جالابينو سيصل إلى مرحلة النشر المخطط لها. وتقول شركة OpenAI إنها تعتزم البدء في نشر الشريحة ضمن البنية التحتية للحوسبة الخاصة بها بحلول نهاية عام 2026، بينما يستمر تأهيل الإنتاج والعمل البرمجي. سيثبت النشر أن النظام قد تجاوز العروض التوضيحية المعيارية، لكن المصدر لا يحدد النطاق الأولي أو المواقع أو أعباء العمل أو ما إذا كان المستخدمون سيلاحظون تغييرًا على مستوى المنتج.
هناك حاجة إلى مزيد من الأدلة على منهجية الاستنساخ والمقارنة. استخدمت OpenAI معيارًا عامًا، لكن المصدر لا يوفر البيانات المعيارية الكاملة، أو عدد الرقائق أو الأنظمة التي تم اختبارها، أو إصدارات البرامج، أو مستويات الاستخدام، أو التبريد وطاقة المنشأة، أو التحقق المستقل من صحة نتائج المقارنة. ونظرًا لأن النسب الرئيسية تم تطبيعها باستخدام تقييمات قوة الرقاقة المنشورة، في حين يتم أيضًا الإبلاغ عن الطاقة المستدامة لـ Jalapeño بشكل منفصل، فيجب على القراء التمييز بين الكفاءة على مستوى الحزمة وبين الكفاءة الإجمالية لمركز البيانات.
ستكون تغطية النموذج مهمة. OpenAI تعلن عن نتائج GPT-OSS 120B وDeepSeek R1 670B وKimi K2.5 1T، وتقول إن الاختبار الداخلي أظهر ميزة أوسع في نماذج OpenAI الحدودية. ولم يحدد المصدر تلك النماذج الداخلية أو ينشر نتائجها. وتقول أيضًا إن كل عائلة طراز إضافية تتطلب حبات جديدة وتحسينًا خاصًا بالطراز، مما يعني أن مرونة الشريحة قد تعتمد على استمرار عمل البرنامج بدلاً من الأجهزة وحدها.
تقول OpenAI إن الجيل الثاني عميق في التطوير وأن الجيل الثالث يتشكل، مع التأكيد أيضًا على أنها ستواصل نشر المسرعات من NVIDIA والشركاء الآخرين للتدريب والاستدلال. وبالتالي، فإن المجهول المهم ليس ببساطة ما إذا كان جالابينو أسرع في الاختبارات المبلغ عنها، ولكن كيف يتناسب مع استراتيجية البنية التحتية المختلطة، ومقدار السعة التي ستمثلها، وما إذا كانت الأجيال القادمة ستحافظ على التوازن بين الإنتاجية وزمن الوصول والكفاءة ودعم بنيات النماذج المتغيرة.