ماذا حدث
وصف الباحثون كيف يتصرف نموذج لغة الانتشار المقنع في ظل حمل الخدمة المتزامن على أجهزة حقيقية، ووجدوا أن احتياجات الكمون والتجميع الخاصة به تختلف عن تلك الخاصة بنماذج اللغة التقليدية ذات الانحدار الذاتي.
تتناول الورقة المقدمة إلى arXiv في 24 أغسطس نماذج لغة الانتشار المقنع، أو dLLMs. على عكس أنظمة الانحدار التلقائي التي تولد النص بشكل تسلسلي، يمكن لـ dLLMs تقليل الضوضاء من الرموز المميزة المتعددة في وقت واحد. يجادل المؤلفون بأن هذا الاختلاف يجعل تصميم أنظمة خدمة dLLM أمرًا محفوفًا بالمخاطر بمجرد نقل الافتراضات من خدمة نموذج الانحدار الذاتي. وتتمثل مساهمتهم المركزية في التوصيف التجريبي تحت الحمل المتزامن بدلاً من المناقشة النظرية البحتة. وبالتالي، تضع هذه الورقة السؤال المطروح حول العواقب التشغيلية لآلية التوليد تلك. تتعلق مقارنتها بسلوك النظام تحت الحمل، حيث ينتج النموذج رموزًا متعددة من خلال تقليل الضوضاء المتكرر بدلاً من اتباع مسار تسلسلي واحد.
استخدم الباحثون LLaDA-8B-Instruct مع محول Discrete Diffusion Forcing LoRA على وحدة معالجة الرسومات NVIDIA H200 واحدة. قاموا بتقييم الإعداد على GSM8K وHumanEval. تشير الأوراق البحثية إلى أن صعوبة الطلب منفصلة: حيث تنقسم الطلبات إلى 11 مستوى ثابتًا من خطوات تقليل الضوضاء. اختبر المؤلفون ما إذا كانت أي إشارة يمكنها التنبؤ بمستوى الطلب قبل بدء الإنشاء، ولكن أفضل قيمة R2 تم الإبلاغ عنها كانت 0.150، مما يشير إلى ضعف الأداء التنبؤي في تجربتهم. تحدد هذه الاختيارات نطاق القياسات. تصف الملاحظات المبلغ عنها المجموعة التي تم اختبارها من النموذج والمحول ووحدة معالجة الرسومات والمعايير، ويتم تقديم اختبار التنبؤ كجزء من نفس التوصيف.
تشير الدراسة أيضًا إلى أن ميزانيات الجيل القصير يمكن أن تخفي تقلبات الخدمة. وفقًا للورقة البحثية، قد تؤدي الميزانيات التي تقل عن 320 رمزًا إلى قطع الطلبات قبل أن يصبح انتشار زمن الاستجابة مرئيًا. على نطاق الطلب الفردي، كان 24% فقط من وقت ساعة الحائط عبارة عن حساب وحدة معالجة الرسومات، بينما كان الباقي عبارة عن نفقات إضافية من جانب وحدة المعالجة المركزية. عندما تم تجميع الطلبات بحيث تتم مشاركة تمرير أمامي واحد لكل خطوة تقليل الضوضاء، كانت الإنتاجية أعلى بمقدار 16.0 مرة عند حجم الدُفعة 16 مقارنةً بخط الأساس للإرسال لكل طلب. تستمد الورقة أيضًا قاعدة مهلة الدُفعة للدفعات المتزامنة ذات التعبئة الثابتة ضمن عمليات وصول Poisson. تعمل هذه القياسات معًا على ربط السلوك على مستوى الطلب بالجدولة على مستوى النظام. وهي تصف كلا من المكان الذي يتم قضاء الوقت فيه وكيف تؤدي مشاركة العمل عبر الطلبات إلى تغيير الإنتاجية المُبلغ عنها، مع الحفاظ على تحليل مهلة الدُفعة مرتبطًا بنموذج الوصول.
لماذا يهم
يمكن أن تساعد النتائج المهندسين على تصميم بنية تحتية أكثر كفاءة لنماذج اللغة القائمة على الانتشار، في حين تظهر أيضًا أن المعايير والافتراضات القصيرة الموروثة من خدمة الانحدار الذاتي يمكن أن تخفي تكاليف تشغيلية مهمة.
الأهمية العملية هي أن خدمة dLLM قد تتطلب التوازي على مستوى مختلف عن خدمة الانحدار الذاتي. في تقرير الصحيفة، الوحدة الأساسية لتقاسم العمل هي كل خطوة مزعجة، وليس مجرد الطلب بأكمله. يؤدي ذلك إلى تغيير الطريقة التي يجب أن يفكر بها نظام التقديم في القبول والتجميع والإخلاء عندما تتقدم الطلبات المتعددة من خلال الحساب المشترك. والنتيجة هي درس في الأنظمة حول مطابقة البنية التحتية لعملية إنشاء النموذج. يؤثر هذا التمييز على طريقة تقييم مكونات الخدمة. إن القبول والتجميع والإخلاء ليست مجرد تفاصيل تنفيذية في هذا الإطار؛ فهي جزء من تكييف النظام مع عملية تقليل الضوضاء الخاصة بالنموذج.
تعتبر النتائج العامة لوحدة المعالجة المركزية ذات صلة بشكل خاص باقتصاديات النشر وهندسة الأداء. إذا تم قضاء أقلية فقط من وقت ساعة الحائط ذات الطلب الفردي في حساب وحدة معالجة الرسومات في هذا التكوين الذي تم اختباره، فإن إضافة المزيد من سعة المسرع قد لا يعالج عنق الزجاجة السائد في حد ذاته. تشير نتيجة التجميع المبلغ عنها إلى أن طلبات التنسيق يمكن أن تستهلك تكاليف الإرسال، على الرغم من أن نتيجة الورقة مرتبطة بنموذجها المحدد، ومهايئها، وأجهزتها، وعبء العمل، وخط الأساس. المعنى الضمني هو الحاجة إلى فحص المسار الكامل من وصول الطلب إلى عمل التسريع. تجعل قياسات الورقة هذا المسار مرئيًا في الإعداد الذي تم اختباره، وتوضح نتيجة التجميع سبب أهمية موقع النفقات العامة عند تقييم الأداء.
تتحدى الورقة أيضًا كيفية قياس معايير dLLMs. يمكن لميزانية الجيل القصير أن تجعل زمن الوصول يبدو أكثر اتساقًا مما هو عليه بالفعل لأن الطلب ينتهي قبل ظهور الاختلاف الكامل في خطوات تقليل الضوضاء. وهذا مهم لأي شخص يقارن أنظمة العرض أو يقدر أوقات الاستجابة المرئية للمستخدم. يجادل المؤلفون من الناحية الهيكلية بأن جودة المخرجات لا ينبغي أن تتدهور مع زيادة حجم الدفعة في ظل ثلاثة افتراضات معلنة، لكن تقارير المصدر قامت بقياس دقة GSM8K فقط على مقياس الطلب الفردي، حيث كانت 74% إلى 76%. وهذا لا يؤدي إلى عدم تغيير الجودة في كل حالة تجميع. ولهذا السبب أيضًا تفصل الورقة بين الاستدلال الهيكلي والأدلة المقاسة. تدعم الافتراضات حجة المؤلفين المعلنة، في حين يظل قياس الدقة المُبلغ عنه مقتصراً على نتيجة الطلب الفردي المذكورة ولا يجيب على سؤال التجميع الأوسع.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
تعد الدراسة توصيفًا مبكرًا يعتمد على تكوين نموذج واحد ووحدة معالجة رسومات واحدة ومعيارين قياسيين. وستكون هناك حاجة إلى اختبارات مستقلة عبر النماذج والأجهزة وأحمال العمل وإعدادات الإنتاج لتحديد مدى تطبيق النتائج على نطاق واسع.
أكبر مجهول هو التعميم. تستخدم التجربة تكوينًا واحدًا لنموذج الانتشار المقنع، LLaDA-8B-Instruct مع محول D2F LoRA، ووحدة معالجة الرسومات NVIDIA H200 واحدة. لا يحدد المصدر ما إذا كانت نفس مستويات عدد الخطوات الـ 11، أو ضعف القدرة على التنبؤ قبل الإنشاء، أو توازن توقيت وحدة المعالجة المركزية (CPU) إلى وحدة معالجة الرسومات (CPU)، أو كسب الدفع بمعدل 16.0x ستظهر مع وحدات dLLM الأخرى، أو المحولات، أو المسرعات، أو مجموعات البرامج، أو مجموعات الطلبات. هذه الحدود مهمة عند تفسير النتائج. تعتبر النتائج دليلاً على الإعداد الذي تم اختباره، وليست خريطة كاملة لسلوك خدمة الانتشار المقنع عبر جميع التكوينات الممكنة.
يجب أن يختبر العمل الإضافي حركة المرور الشبيهة بالإنتاج والمخرجات الأطول أو الأكثر تنوعًا. تحذر الورقة على وجه التحديد من أن الميزانيات التي تقل عن 320 رمزًا يمكن أن تخفي انتشار زمن الاستجابة، لذلك يجب أن تتضمن التقييمات أعباء العمل لفترة كافية لكشف سلوك تقليل الضوضاء الكامل. سيكون من المهم أيضًا قياس زمن الوصول والإنتاجية واستخدام الذاكرة والجودة بشكل مشترك بدلاً من التعامل مع رقم إنتاجية واحد كدليل كافٍ على ميزة النشر. ومن شأن مثل هذه القياسات أن تسهل التمييز بين التحسن في متوسط الإنتاجية والتحسين الذي يظل مفيدًا في ظل حركة المرور الحقيقية. وسوف تظهر أيضًا ما إذا كان سلوك الجدولة الملحوظ يستمر عند تغيير عبء العمل وطول الإخراج.
تظل المطالبة بالجودة مشروطة. يذكر المؤلفون أن الجودة لا ينبغي أن تتدهور مع حجم الدفعة في ظل ثلاثة افتراضات، لكن المصدر لا يحدد مجموعة واسعة من نتائج دقة حجم الدفعة، كما أنه لا يبلغ عن توفر الإنتاج أو عمليات النشر التي تواجه المستخدم. سيساعد النسخ المتماثل المستقل عبر GSM8K وHumanEval ومهام أخرى في تحديد ما إذا كان التجميع المتزامن مبدأ تصميم مفيدًا على نطاق واسع أم أنه في الأساس تحسين لهذا الإعداد التجريبي. وإلى أن تصبح هذه الاختبارات متاحة، فإن القراءة الأكثر دفاعًا تكون مشروطة: فالتجميع المتزامن هو مبدأ تصميم واعد في الإعداد المبلغ عنه، في حين تظل قيمة النشر الأوسع الخاصة به غير محددة.