العودة إلى الأخبار
الابتكارAI Understanding إحاطة

يقترح الباحثون خلط التنشيط التكيفي للرمز المميز لطبقات التغذية الأمامية للمحولات

تقترح النسخة الأولية المنقحة من arXiv مزيجًا من التنشيطات، وهو تصميم طبقة تغذية للأمام يتيح لنماذج اللغة الاختيار من بين وظائف التنشيط لكل رمز مميز. أبلغ المؤلفون عن انخفاض فقدان التدريب النهائي في النماذج من 0.12B إلى 2B، لكنهم لم يقدموا نتائج دقيقة في السجل المصدر.

5 min readRead the primary source
Source-page capture accompanying Researchers propose token-adaptive activation mixing for Transformer feedforward layers
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2605.26647
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

محول
بنية عصبية تستخدم الانتباه إلى العلاقات النموذجية عبر التسلسلات بالتوازي.
رمز مميز
جزء من النص تتم معالجته بواسطة نماذج اللغة، مثل قطعة كلمة أو رمز.
الذاكرة (ذاكرة الوكيل)
السياق المُخزن الذي يستخدمه وكيل الذكاء الاصطناعي عبر الخطوات أو الجلسات لتحسين الاستمرارية.
اختبر نفسكوأوضح نماذج الذكاء الاصطناعي مسابقة

ماذا حدث

تقترح ورقة تمت مراجعتها على arXiv في 28 أغسطس مزيجًا من التنشيطات، أو MoA، لنماذج اللغة القائمة على المحولات. يستخدم التصميم بوابات خفيفة الوزن تعتمد على المدخلات لخلط العديد من وظائف التنشيط للرموز الفردية مع مشاركة نفس الإسقاطات الخطية. يقدم المؤلفون أيضًا عمليات تنشيط قابلة للتعلم تجمع بين الوظائف دون بوابات تعتمد على الرمز المميز.

المصدر المعتمد هو سجل arXiv لـ "طبقات التغذية الأمامية الأكثر تعبيرًا: الجزء الأول. الخلط التكيفي للرمز المميز للتنشيطات." وتقول إن الورقة تم تقديمها لأول مرة في 26 مايو 2026، وتمت مراجعتها في 28 أغسطس، ووضع التحديث الجوهري داخل نافذة الأخبار الحالية. المؤلفون هم مينجز وانغ، وجينبو وانغ، وييكوان شيا، وكاي شين، وشو تشونغ. يحدد المصدر العمل على أنه ورقة بحثية عن التعلم الآلي والذكاء الاصطناعي، مع نماذج لغوية كموضوع مباشر لها.

تبدأ الورقة من القيود التي حددها المؤلفون في طبقات شبكة التغذية الأمامية للمحولات الشائعة، أو FFN. استخدمت التصميمات السابقة وظائف مثل ReLU وGELU، بينما تتضمن التصميمات المسورة اللاحقة SwiGLU، لكن المصدر يقول إن معظم FFNs لا تزال تطبق تحويلًا غير خطي ثابتًا واحدًا على كل رمز مميز. يستخدم مزيج التنشيطات المقترح بدلاً من ذلك قاموسًا لوظائف التنشيط والبوابات خفيفة الوزن التي تعتمد قيمها على المدخلات. تتم مشاركة نفس الإسقاطات الخطية، في حين أن مزيج الوظائف غير الخطية يمكن أن يختلف من رمز إلى آخر.

يصف المصدر أيضًا عمليات التنشيط القابلة للتعلم، والمختصرة LA، باعتبارها نظيرًا مستقلاً عن المدخلات. تشكل LA مجموعات خطية من وظائف التنشيط في كل من FFNs من نوع ReLU وSwiGLU. يذكر المؤلفون أن نظرية العرض المحدود الخاصة بهم تؤسس لفصلات تعبيرية صارمة: تحتوي LA بشكل صارم على FFNs ذات التنشيط الثابت، في حين تحتوي MoA بشكل صارم على LA لأنها تضيف تهجينًا غير خطي يعتمد على المدخلات. هذه هي ادعاءات تعبيرية نظرية حول الوظائف التي يمكن أن تمثلها الطبقات، وليست دليلاً على أن نموذج اللغة المنتشر أكثر قدرة أو موثوقية بشكل عام.

بالنسبة للاختبار التجريبي، يقول المؤلفون إنهم أجروا تجارب مكثفة للتدريب المسبق على نماذج لغوية كثيفة ومختلطة من الخبراء تتراوح من 0.12 مليار إلى 2 مليار معلمة. لقد أبلغوا عن اختبار ميزانيات الرموز المميزة والمحسنات وجداول معدل التعلم. وفقًا للملخص، حققت وزارة الزراعة باستمرار خسارة طرفية أقل وأظهرت سلوكًا مناسبًا للقياس أكثر من خطوط الأساس المضبوطة جيدًا، مع الحد الأدنى من المعلمات والنفقات الحسابية. لا يوفر السجل المصدر فروق الخسارة الرقمية، أو أسماء مجموعات البيانات أو خطوط الأساس، أو تفاصيل الأجهزة، أو المعنى الدقيق للحمل "الحد الأدنى".

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

تحتوي طبقات التغذية الأمامية على حصة كبيرة من المعلمات والسلوك غير الخطي في العديد من نماذج اللغة. إذا أدى خلط التنشيط التكيفي للرمز المميز إلى تحسين التدريب دون زيادة الحوسبة أو المعلمات بشكل ملموس، فقد يوفر تغييرًا معماريًا صغيرًا نسبيًا مع آثار على توسيع نطاق النموذج. تظل الأدلة مقتصرة على تجارب ما قبل التدريب التي ذكرها المؤلفون ولا تثبت أداءً أفضل أو كفاءة إنتاجية أفضل.

يستهدف الاقتراح جزءًا مترتبًا من بنية نموذج اللغة الحالية. يقول المصدر أن طبقات FFN تمثل جزءًا كبيرًا من معلمات نموذج المحولات والتعبير غير الخطي. وهذا يجعلها مكانًا مهمًا للبحث عن التحسينات: يمكن أن يؤثر التغيير في التحويل غير الخطي على مدى كفاءة النموذج في استخدام عرضه وإسقاطاته الحالية، بدلاً من الحاجة إلى عائلة نموذجية مختلفة تمامًا.

من المحتمل أن يكون تصميم MoA عمليًا لأنه يحتفظ بالإسقاطات الخطية المشتركة ويضيف بوابة خفيفة الوزن تعتمد على المدخلات. من حيث المبدأ، قد يسمح هذا للرموز المختلفة بتلقي معالجة غير خطية مختلفة مع الحفاظ على جزء كبير من بنية FFN المحيطة. ومع ذلك، لا يثبت المصدر أنه يمكن ترقية النماذج الحالية دون إعادة التدريب، كما أنه لا يذكر تفاصيل التنفيذ الكافية لتحديد ما إذا كانت البوابات المضافة تعمل على تحسين الإنتاجية في العالم الحقيقي، أو استخدام الذاكرة، أو استهلاك الطاقة.

تعتبر الخسارة الطرفية المنخفضة المبلغ عنها ذات صلة لأن خسارة التدريب هي مقياس مركزي لمدى ملاءمة النموذج لبيانات ما قبل التدريب الخاصة به. قد يكون سلوك القياس المزعوم مهمًا أيضًا إذا استمرت الطريقة في التحسن مع زيادة حجم النموذج أو زيادة حساب التدريب. لكن الخسارة النهائية ليست هي نفس الفائدة للناس. لا يقدم المصدر أي نتائج تتعلق بالواقعية، أو الاستدلال، أو الترميز، أو الأداء متعدد اللغات، أو السلامة، أو المعايرة، أو القوة، أو دقة المهام النهائية، وبالتالي فإن الأهمية العملية لمكاسب التدريب المبلغ عنها تظل غير مؤكدة.

الأدلة أولية أيضًا. إنه يأتي من نسخة أولية منقحة، ويقدم السجل المصدر استنتاجات المؤلفين النظرية والتجريبية بدلاً من التحقق المستقل. وينتهي النطاق الذي تم اختباره عند 2 مليار معلمة، وهو أصغر ماديًا من العديد من نماذج اللغات المنتشرة على نطاق واسع. لا يذكر السجل ما إذا كانت التجارب استخدمت بذورًا عشوائية متعددة، أو كيف تم ضبط خطوط الأساس، أو ما إذا كانت الطريقة تغير زمن الوصول الاستدلالي، أو ما إذا كانت مكاسبها تستمر خارج إعدادات التدريب المسبق المُبلغ عنها.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
التحقق من المفهوم التفاعلي+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ماذا تشاهد بعد ذلك

الدليل التالي المهم هو حجم واتساق المكاسب المبلغ عنها، خاصة خارج نطاق 0.12B إلى 2B الذي تم اختباره. يجب على القراء البحث عن النفقات العامة الدقيقة للحساب والذاكرة وزمن الوصول والمعلمات؛ النتائج على المهام النهائية؛ النسخ المتماثل المستقل والدليل على أن الطريقة تظل مفيدة عبر البنى ومجموعات البيانات وأدوات التحسين وعمليات التدريب الأطول.

الفحص المفيد التالي هو التفاصيل الكمية. يجب أن يُظهر البحث الكامل أو العمل اللاحق منحنيات الخسارة الدقيقة، والثقة أو تباين التشغيل للتشغيل، وعدد المعلمات، وعدد العمليات، ومتطلبات الذاكرة، وتكاليف التدريب على ساعة الحائط لـ MoA، وLA، وخطوط الأساس للتنشيط الثابت. نظرًا لأن الملخص ينص على أن المقارنات كانت مقابل خطوط أساس مضبوطة جيدًا، فإن إجراء الضبط وميزانية الحوسبة سيكونان مهمين للحكم على ما إذا كانت الميزة تأتي من البنية أم لا من التحسين غير المتكافئ.

النطاق هو قضية أخرى لم يتم حلها. يذكر المصدر نماذج من 0.12B إلى 2B من المعلمات، لكنه لا يوضح ما إذا كان النمط نفسه ينطبق على الأنظمة ذات الكثافة الأكبر أو أنظمة خليط من الخبراء. يجب أن تختبر التجارب المستقبلية نماذج أكبر، وعمليات تدريب أطول، وميزانيات رمزية إضافية، ومزيجًا مختلفًا من البيانات. ويجب عليهم أيضًا توضيح ما إذا كان سلوك القياس المفضل المُطالب به يتم قياسه بالخسارة عند موازنة حساب ثابتة، أو بالخسارة عند عدد معلمات ثابت، أو بمقارنة أخرى.

التكاليف التشغيلية تستحق اهتماما وثيقا. تقدم MoA بوابة تعتمد على الرمز المميز وقاموسًا لوظائف التنشيط، حتى لو تم وصف المعلمة المضافة وعبء الحوسبة بالحد الأدنى. يجب أن تحدد القياسات المستقلة ما إذا كان هذا يؤدي إلى تغييرات ذات معنى في استخدام المسرع، أو حركة الذاكرة، أو التجميع، أو زمن الوصول الاستدلالي، أو استقرار التدريب، أو استخدام الطاقة. يمكن أن يكون للحمل النظري الصغير تكلفة أكبر للأنظمة إذا أدى إلى تعطيل التنفيذ الفعال للأجهزة.

وأخيرا، يجب على القراء البحث عن تكرار مستقل وتقييم أوسع. ستُظهر النتائج المتعلقة باللغة النهائية والترميز والاستدلال والمهام متعددة اللغات ما إذا كان انخفاض خسارة التدريب المسبق ينتقل إلى القدرات التي يلاحظها المستخدمون. ستختبر تقييمات الموثوقية والسلامة ما إذا كان السلوك غير الخطي المتكيف مع الرمز المميز يقدم أنماط فشل جديدة. وإلى أن تتوفر هذه النتائج، من الأفضل فهم الورقة على أنها ادعاء بحثي معماري واعد، وليس تحسينًا مثبتًا للإنتاج أو منتجًا متاحًا على الفور.

الأدلة والاختبارات ذات الصلة

شرح نماذج الذكاء الاصطناعيالمحولاتتدريب الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟