ماذا حدث
تقترح ورقة تمت مراجعتها على arXiv في 28 أغسطس مزيجًا من التنشيطات، أو MoA، لنماذج اللغة القائمة على المحولات. يستخدم التصميم بوابات خفيفة الوزن تعتمد على المدخلات لخلط العديد من وظائف التنشيط للرموز الفردية مع مشاركة نفس الإسقاطات الخطية. يقدم المؤلفون أيضًا عمليات تنشيط قابلة للتعلم تجمع بين الوظائف دون بوابات تعتمد على الرمز المميز.
المصدر المعتمد هو سجل arXiv لـ "طبقات التغذية الأمامية الأكثر تعبيرًا: الجزء الأول. الخلط التكيفي للرمز المميز للتنشيطات." وتقول إن الورقة تم تقديمها لأول مرة في 26 مايو 2026، وتمت مراجعتها في 28 أغسطس، ووضع التحديث الجوهري داخل نافذة الأخبار الحالية. المؤلفون هم مينجز وانغ، وجينبو وانغ، وييكوان شيا، وكاي شين، وشو تشونغ. يحدد المصدر العمل على أنه ورقة بحثية عن التعلم الآلي والذكاء الاصطناعي، مع نماذج لغوية كموضوع مباشر لها.
تبدأ الورقة من القيود التي حددها المؤلفون في طبقات شبكة التغذية الأمامية للمحولات الشائعة، أو FFN. استخدمت التصميمات السابقة وظائف مثل ReLU وGELU، بينما تتضمن التصميمات المسورة اللاحقة SwiGLU، لكن المصدر يقول إن معظم FFNs لا تزال تطبق تحويلًا غير خطي ثابتًا واحدًا على كل رمز مميز. يستخدم مزيج التنشيطات المقترح بدلاً من ذلك قاموسًا لوظائف التنشيط والبوابات خفيفة الوزن التي تعتمد قيمها على المدخلات. تتم مشاركة نفس الإسقاطات الخطية، في حين أن مزيج الوظائف غير الخطية يمكن أن يختلف من رمز إلى آخر.
يصف المصدر أيضًا عمليات التنشيط القابلة للتعلم، والمختصرة LA، باعتبارها نظيرًا مستقلاً عن المدخلات. تشكل LA مجموعات خطية من وظائف التنشيط في كل من FFNs من نوع ReLU وSwiGLU. يذكر المؤلفون أن نظرية العرض المحدود الخاصة بهم تؤسس لفصلات تعبيرية صارمة: تحتوي LA بشكل صارم على FFNs ذات التنشيط الثابت، في حين تحتوي MoA بشكل صارم على LA لأنها تضيف تهجينًا غير خطي يعتمد على المدخلات. هذه هي ادعاءات تعبيرية نظرية حول الوظائف التي يمكن أن تمثلها الطبقات، وليست دليلاً على أن نموذج اللغة المنتشر أكثر قدرة أو موثوقية بشكل عام.
بالنسبة للاختبار التجريبي، يقول المؤلفون إنهم أجروا تجارب مكثفة للتدريب المسبق على نماذج لغوية كثيفة ومختلطة من الخبراء تتراوح من 0.12 مليار إلى 2 مليار معلمة. لقد أبلغوا عن اختبار ميزانيات الرموز المميزة والمحسنات وجداول معدل التعلم. وفقًا للملخص، حققت وزارة الزراعة باستمرار خسارة طرفية أقل وأظهرت سلوكًا مناسبًا للقياس أكثر من خطوط الأساس المضبوطة جيدًا، مع الحد الأدنى من المعلمات والنفقات الحسابية. لا يوفر السجل المصدر فروق الخسارة الرقمية، أو أسماء مجموعات البيانات أو خطوط الأساس، أو تفاصيل الأجهزة، أو المعنى الدقيق للحمل "الحد الأدنى".
لماذا يهم
تحتوي طبقات التغذية الأمامية على حصة كبيرة من المعلمات والسلوك غير الخطي في العديد من نماذج اللغة. إذا أدى خلط التنشيط التكيفي للرمز المميز إلى تحسين التدريب دون زيادة الحوسبة أو المعلمات بشكل ملموس، فقد يوفر تغييرًا معماريًا صغيرًا نسبيًا مع آثار على توسيع نطاق النموذج. تظل الأدلة مقتصرة على تجارب ما قبل التدريب التي ذكرها المؤلفون ولا تثبت أداءً أفضل أو كفاءة إنتاجية أفضل.
يستهدف الاقتراح جزءًا مترتبًا من بنية نموذج اللغة الحالية. يقول المصدر أن طبقات FFN تمثل جزءًا كبيرًا من معلمات نموذج المحولات والتعبير غير الخطي. وهذا يجعلها مكانًا مهمًا للبحث عن التحسينات: يمكن أن يؤثر التغيير في التحويل غير الخطي على مدى كفاءة النموذج في استخدام عرضه وإسقاطاته الحالية، بدلاً من الحاجة إلى عائلة نموذجية مختلفة تمامًا.
من المحتمل أن يكون تصميم MoA عمليًا لأنه يحتفظ بالإسقاطات الخطية المشتركة ويضيف بوابة خفيفة الوزن تعتمد على المدخلات. من حيث المبدأ، قد يسمح هذا للرموز المختلفة بتلقي معالجة غير خطية مختلفة مع الحفاظ على جزء كبير من بنية FFN المحيطة. ومع ذلك، لا يثبت المصدر أنه يمكن ترقية النماذج الحالية دون إعادة التدريب، كما أنه لا يذكر تفاصيل التنفيذ الكافية لتحديد ما إذا كانت البوابات المضافة تعمل على تحسين الإنتاجية في العالم الحقيقي، أو استخدام الذاكرة، أو استهلاك الطاقة.
تعتبر الخسارة الطرفية المنخفضة المبلغ عنها ذات صلة لأن خسارة التدريب هي مقياس مركزي لمدى ملاءمة النموذج لبيانات ما قبل التدريب الخاصة به. قد يكون سلوك القياس المزعوم مهمًا أيضًا إذا استمرت الطريقة في التحسن مع زيادة حجم النموذج أو زيادة حساب التدريب. لكن الخسارة النهائية ليست هي نفس الفائدة للناس. لا يقدم المصدر أي نتائج تتعلق بالواقعية، أو الاستدلال، أو الترميز، أو الأداء متعدد اللغات، أو السلامة، أو المعايرة، أو القوة، أو دقة المهام النهائية، وبالتالي فإن الأهمية العملية لمكاسب التدريب المبلغ عنها تظل غير مؤكدة.
الأدلة أولية أيضًا. إنه يأتي من نسخة أولية منقحة، ويقدم السجل المصدر استنتاجات المؤلفين النظرية والتجريبية بدلاً من التحقق المستقل. وينتهي النطاق الذي تم اختباره عند 2 مليار معلمة، وهو أصغر ماديًا من العديد من نماذج اللغات المنتشرة على نطاق واسع. لا يذكر السجل ما إذا كانت التجارب استخدمت بذورًا عشوائية متعددة، أو كيف تم ضبط خطوط الأساس، أو ما إذا كانت الطريقة تغير زمن الوصول الاستدلالي، أو ما إذا كانت مكاسبها تستمر خارج إعدادات التدريب المسبق المُبلغ عنها.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
الدليل التالي المهم هو حجم واتساق المكاسب المبلغ عنها، خاصة خارج نطاق 0.12B إلى 2B الذي تم اختباره. يجب على القراء البحث عن النفقات العامة الدقيقة للحساب والذاكرة وزمن الوصول والمعلمات؛ النتائج على المهام النهائية؛ النسخ المتماثل المستقل والدليل على أن الطريقة تظل مفيدة عبر البنى ومجموعات البيانات وأدوات التحسين وعمليات التدريب الأطول.
الفحص المفيد التالي هو التفاصيل الكمية. يجب أن يُظهر البحث الكامل أو العمل اللاحق منحنيات الخسارة الدقيقة، والثقة أو تباين التشغيل للتشغيل، وعدد المعلمات، وعدد العمليات، ومتطلبات الذاكرة، وتكاليف التدريب على ساعة الحائط لـ MoA، وLA، وخطوط الأساس للتنشيط الثابت. نظرًا لأن الملخص ينص على أن المقارنات كانت مقابل خطوط أساس مضبوطة جيدًا، فإن إجراء الضبط وميزانية الحوسبة سيكونان مهمين للحكم على ما إذا كانت الميزة تأتي من البنية أم لا من التحسين غير المتكافئ.
النطاق هو قضية أخرى لم يتم حلها. يذكر المصدر نماذج من 0.12B إلى 2B من المعلمات، لكنه لا يوضح ما إذا كان النمط نفسه ينطبق على الأنظمة ذات الكثافة الأكبر أو أنظمة خليط من الخبراء. يجب أن تختبر التجارب المستقبلية نماذج أكبر، وعمليات تدريب أطول، وميزانيات رمزية إضافية، ومزيجًا مختلفًا من البيانات. ويجب عليهم أيضًا توضيح ما إذا كان سلوك القياس المفضل المُطالب به يتم قياسه بالخسارة عند موازنة حساب ثابتة، أو بالخسارة عند عدد معلمات ثابت، أو بمقارنة أخرى.
التكاليف التشغيلية تستحق اهتماما وثيقا. تقدم MoA بوابة تعتمد على الرمز المميز وقاموسًا لوظائف التنشيط، حتى لو تم وصف المعلمة المضافة وعبء الحوسبة بالحد الأدنى. يجب أن تحدد القياسات المستقلة ما إذا كان هذا يؤدي إلى تغييرات ذات معنى في استخدام المسرع، أو حركة الذاكرة، أو التجميع، أو زمن الوصول الاستدلالي، أو استقرار التدريب، أو استخدام الطاقة. يمكن أن يكون للحمل النظري الصغير تكلفة أكبر للأنظمة إذا أدى إلى تعطيل التنفيذ الفعال للأجهزة.
وأخيرا، يجب على القراء البحث عن تكرار مستقل وتقييم أوسع. ستُظهر النتائج المتعلقة باللغة النهائية والترميز والاستدلال والمهام متعددة اللغات ما إذا كان انخفاض خسارة التدريب المسبق ينتقل إلى القدرات التي يلاحظها المستخدمون. ستختبر تقييمات الموثوقية والسلامة ما إذا كان السلوك غير الخطي المتكيف مع الرمز المميز يقدم أنماط فشل جديدة. وإلى أن تتوفر هذه النتائج، من الأفضل فهم الورقة على أنها ادعاء بحثي معماري واعد، وليس تحسينًا مثبتًا للإنتاج أو منتجًا متاحًا على الفور.