RMSNorm وتطبيع الطبقة المسبقة
RMSNorm عبارة عن طبقة تسوية خفيفة الوزن تعمل على إعادة قياس عمليات التنشيط حسب مربع متوسط الجذر الخاص بها، وتضع تسوية الطبقة المسبقة خطوة قبل كل طبقة فرعية وليس بعدها.
نظرة عامة
Together they make deep transformers train stably without warmup tricks.
الغوص العميق
يقوم Standard LayerNorm بطرح المتوسط والقسمة على الانحراف المعياري عبر متجه المعالم، ثم يطبق مقياسًا وإزاحة تم تعلمهما. RMSNorm، الذي قدمه Zhang وSennrich في عام 2019، يسقط متوسط التمركز والتحيز تمامًا: فهو ببساطة يقسم كل متجه على جذر متوسط مربع عناصره ويضربه في الربح المكتسب لكل ميزة. يؤدي هذا إلى إزالة إحصائية واحدة والعديد من العمليات، مما يقلل الحوسبة بنسبة 10-50% تقريبًا في الطبقة المعيارية مع مطابقة الدقة. بشكل منفصل، فإن موضع "ما قبل LN" (المعيار قبل الانتباه/MLP، مع مسار متبقي نظيف حوله) يحافظ على مقادير التدرج محدودة عند التهيئة، لذلك تتدرب نماذج مثل GPT-3 وLLaMA وPaLM دون اختراقات إحماء معدل التعلم التي يتطلبها محول Post-LN الأصلي.
البصيرة الفنية
بالنسبة للمتجه x للبعد d، يحسب RMSNorm x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon)، حيث g هو متجه الكسب المكتسب. لا يوجد أي طرح متوسط ولا تحيز. نظرًا لأن التدفق المتبقي في كتلة ما قبل LN يتجاوز التسوية، يظل مسار الهوية دون تغيير وتتدفق التدرجات مباشرة من الإخراج إلى الإدخال، وهذا هو سبب تقارب الأكوام العميقة جدًا.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل RMSNorm وتطبيع الطبقة المسبقة
أصبح RMSNorm الآن هو الإعداد الافتراضي في معظم برامج LLM ذات الوزن المفتوح (LLaMA، وMistral، وQwen، وGemma)، لذا توقع أن يظل قياسيًا. يعمل البحث على تحسين الوصفة: يطبق معيار QK RMSNorm على استعلامات الانتباه ومفاتيح ترويض نمو اللوغاريتم، وتجمع بعض المختبرات بين المعيار السابق واللاحق ("الساندويتش" أو "Peri-LN") لتحقيق مزيد من الاستقرار على مقياس تريليون معلمة. تستمر حبات الأجهزة في دمج العملية من أجل السرعة.
التنفيذ في العالم الحقيقي
يقوم كل من LLaMA وMistral وQwen باستبدال LayerNorm بـ RMSNorm لتقليص زمن الوصول للاستدلال على كل رمز مميز
يتيح Pre-LN لنماذج نمط GPT التدريب دون الحاجة إلى تسخين معدل التعلم الذي يحتاجه محول Post-LN لعام 2017
يستخدم تطبيع QK RMSNorm في استعلامات الانتباه والمفاتيح لمنع انفجار السجلات في النماذج الكبيرة
تعتمد محولات الأجهزة المحمولة والحافة RMSNorm لأن إسقاط المتوسط والتحيز يقلل من حركة مرور الذاكرة
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the RMSNorm and Pre-Layer Normalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تطبيع الطبقة
الأسئلة المتداولة
What is RMSNorm and Pre-Layer Normalization?
RMSNorm عبارة عن طبقة تسوية خفيفة الوزن تعمل على إعادة قياس عمليات التنشيط حسب مربع متوسط الجذر الخاص بها، وتضع تسوية الطبقة المسبقة خطوة قبل كل طبقة فرعية وليس بعدها. معًا يجعلون المحولات العميقة تتدرب بثبات دون حيل الإحماء.
ما الذي يحذفه RMSNorm مقارنةً بـ LayerNorm القياسي؟
يتخطى RMSNorm عملية الحوسبة وطرح المتوسط، ويتم التسوية فقط من خلال جذر متوسط مربع عمليات التنشيط.
ما هي الكمية التي يقسم بها RMSNorm كل متجه تنشيط؟
يقسم RMSNorm على sqrt متوسط العناصر المربعة، أي جذر متوسط المربع، ثم يطبق الكسب المكتسب.
ما هي الفائدة الرئيسية لتطبيع ما قبل الطبقة مقارنة بتطبيع ما بعد الطبقة؟
يؤدي وضع القاعدة قبل كل طبقة فرعية بمسار متبقي نظيف إلى تحديد أحجام التدرج، مما يزيل الحاجة إلى تهيئة معدل التعلم.
في كتلة ما قبل LN، ما هو المسار الذي تتركه طبقة التسوية دون تغيير عمدًا؟
يقوم Pre-LN بتطبيع الإدخال إلى طبقة فرعية ولكن الاختصار المتبقي يتجاوزها، مما يحافظ على طريق سريع متدرج نظيف.
ما هي عائلات النماذج الحديثة ذات الوزن المفتوح التي تستخدم RMSNorm افتراضيًا؟
أصبح RMSNorm هو التطبيع القياسي في LLaMA وMistral وQwen وGemma وأحدث برامج LLM.