الدليل الفني

تطبيع الطبقة

تعمل تسوية الطبقة على تثبيت التدريب عن طريق إعادة قياس عمليات التنشيط داخل كل مثال فردي بحيث يكون متوسطها وتباين الوحدة صفرًا.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is a quiet but essential ingredient that makes deep transformers trainable.

الغوص العميق

تعالج تقنية تطبيع الطبقة (LayerNorm) التي قدمها Ba وKiros وHinton في عام 2016، مشكلة أن عمليات التنشيط داخل شبكة عميقة يمكن أن تنجرف إلى مستويات مختلفة تمامًا مع مرور الإشارات عبر العديد من الطبقات، مما يؤدي إلى إبطاء التعلم أو زعزعة استقراره. على عكس تسوية الدُفعات، التي تعمل على تسوية كل ميزة عبر الأمثلة في دفعة صغيرة، يقوم LayerNorm بتسوية ميزات مثال واحد. وهذا يجعلها مستقلة عن حجم الدفعة ويمكن استخدامها بنفس القدر في التدريب والاستدلال، وتعمل بشكل طبيعي مع تسلسلات متغيرة الطول، ولهذا السبب أصبحت المعيار للمحولات التي تعمل على تشغيل نماذج اللغة الحديثة. بعد التطبيع، فإنه يطبق مقياسًا قابلاً للتعلم (جاما) وshift (بيتا) حتى تتمكن الشبكة من استعادة أي تمثيل تحتاجه.

البصيرة الفنية

بالنسبة لمتجه الميزة x، يحسب LayerNorm المتوسط ​​والتباين على عناصر هذا المتجه، ثم يقوم بإخراج gamma * (x - mean) / sqrt(variance + epsilon) + beta. ونظرًا لأن الإحصائيات تأتي من عينة واحدة، فإن السلوك يكون متطابقًا سواء كانت الدفعة تحتوي على مثال واحد أو 1000 مثال. متغير أبسط، RMSNorm، يتخطى متوسط ​​الطرح ويقسم فقط على الجذر المتوسط، مما يوفر الحساب؛ يتم استخدامه في نماذج مثل اللاما. التنسيب مهم أيضًا: "المعيار المسبق" (التطبيع قبل كل طبقة فرعية) يجعل تدريب المحولات العميقة أسهل بكثير من تدريب "ما بعد المعيار".

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل تطبيع الطبقة

ويجري تبسيط التطبيع لتحقيق الكفاءة على نطاق واسع. لقد حل RMSNorm محل LayerNorm إلى حد كبير في نماذج اللغات الكبيرة الأحدث لأنه أرخص ويعمل أيضًا، وأصبح الموضع المعياري المسبق الآن هو الوضع الافتراضي للمكدسات العميقة جدًا. يواصل الباحثون استكشاف البنى الخالية من التطبيع والتي تستخدم التهيئة الدقيقة أو حيل القياس بدلاً من ذلك، بهدف تقليل النفقات العامة مع الحفاظ على استقرار التدريب الذي توفره التطبيع.

التنفيذ في العالم الحقيقي

تثبيت كل كتلة محولات في نماذج اللغة مثل GPT وBERT.

تمكين RMSNorm كخيار تسوية أخف داخل نماذج عائلة Llama.

تطبيع بيانات التسلسل ذات الطول المتغير في نماذج الكلام والترجمة حيث تختلف أحجام الدُفعات.

السماح بالتدريب الموثوق به بحجم دفعة واحدة، كما هو الحال في بعض إعدادات التعلم المعزز.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

RMSNorm وتطبيع الطبقة المسبقة

الأسئلة المتداولة

What is Layer Normalization?

تعمل تسوية الطبقة على تثبيت التدريب عن طريق إعادة قياس عمليات التنشيط داخل كل مثال فردي بحيث يكون متوسطها وتباين الوحدة صفرًا. إنه عنصر هادئ ولكنه أساسي يجعل المحولات العميقة قابلة للتدريب.

عبر ما الذي يحسب تطبيع الطبقة متوسطه وتباينه؟

يقوم LayerNorm بتطبيع أبعاد الميزات لعينة فردية، مما يجعلها مستقلة عن الأمثلة الأخرى في المجموعة.

لماذا يفضل تطبيع الطبقة على تطبيع الدفعة في المحولات؟

نظرًا لأن إحصائياتها تأتي من مثال واحد، فإن LayerNorm يتصرف بشكل متسق بغض النظر عن حجم الدفعة ويناسب تسلسلات النص ذات الطول المتغير.

ما الذي تسمح به معلمات جاما وبيتا القابلة للتعلم لـ LayerNorm؟

بعد التطبيع إلى المتوسط ​​الصفري وتباين الوحدة، تقوم مقاييس جاما وبيتا بتغيير النتيجة بحيث لا يتم إجبار النموذج على توزيع ثابت.

كيف يختلف RMSNorm عن LayerNorm القياسي؟

يحذف RMSNorm خطوة توسيط المتوسط ​​ويقيس بواسطة الجذر المتوسط ​​للتنشيطات، وهو أرخص ويستخدم في نماذج مثل Llama.

ما هي المشكلة التي يساعد تطبيع الطبقة بشكل أساسي في حلها في الشبكات العميقة؟

ومع مرور الإشارات عبر العديد من الطبقات، يمكن أن يتضخم حجمها أو يتقلص؛ تحافظ عملية التطبيع على عمليات التنشيط في نطاق ثابت حتى تعمل التدرجات بشكل جيد.