तकनीकी गाइड

आरएमएसनॉर्म और प्री-लेयर सामान्यीकरण

RMSNorm एक हल्की सामान्यीकरण परत है जो सक्रियणों को उनके मूल माध्य वर्ग के आधार पर पुन: मापती है, और प्री-लेयर सामान्यीकरण उन स्थानों को रखती है जो बाद के बजाय प्रत्येक उपपरत से पहले कदम रखते हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Together they make deep transformers train stably without warmup tricks.

गहरा गोता

मानक लेयरनॉर्म माध्य को घटाता है और एक फीचर वेक्टर में मानक विचलन से विभाजित करता है, फिर एक सीखा हुआ पैमाना और बदलाव लागू करता है। 2019 में झांग और सेनरिच द्वारा पेश किया गया RMSNorm, माध्य-केंद्रित और पूर्वाग्रह को पूरी तरह से हटा देता है: यह बस प्रत्येक वेक्टर को उसके तत्वों के मूल माध्य वर्ग से विभाजित करता है और सीखे गए प्रति-सुविधा लाभ से गुणा करता है। यह एक आँकड़ा और कई परिचालनों को हटा देता है, सटीकता का मिलान करते हुए मानक परत में गणना को लगभग 10-50% तक कम कर देता है। अलग से, 'प्री-एलएन' प्लेसमेंट (ध्यान/एमएलपी से पहले का मानदंड, इसके चारों ओर एक साफ अवशिष्ट पथ के साथ) आरंभीकरण के समय ग्रेडिएंट परिमाण को सीमित रखता है, इसलिए जीपीटी-3, एलएलएएमए और पीएएलएम जैसे मॉडल सीखने की दर वार्मअप हैक के बिना ट्रेन करते हैं जो कि मूल पोस्ट-एलएन ट्रांसफार्मर की आवश्यकता होती है।

तकनीकी अंतर्दृष्टि

आयाम d के वेक्टर x के लिए, RMSNorm x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon) की गणना करता है, जहां g एक सीखा हुआ लाभ वेक्टर है। इसमें कोई माध्य घटाव और कोई पूर्वाग्रह नहीं है। क्योंकि प्री-एलएन ब्लॉक में अवशिष्ट धारा सामान्यीकरण को दरकिनार कर देती है, पहचान पथ अछूता रहता है और ग्रेडिएंट सीधे आउटपुट से इनपुट तक प्रवाहित होते हैं, यही कारण है कि बहुत गहरे स्टैक अभिसरण होते हैं।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

आरएमएसनॉर्म और प्री-लेयर सामान्यीकरण का भविष्य

अधिकांश ओपन-वेट एलएलएम (एलएलएएमए, मिस्ट्रल, क्वेन, जेम्मा) में आरएमएसनॉर्म अब डिफ़ॉल्ट है, इसलिए उम्मीद करें कि यह मानक बना रहेगा। अनुसंधान नुस्खा को परिष्कृत कर रहा है: QK-मानदंड लॉगिट वृद्धि को नियंत्रित करने के लिए ध्यान संबंधी प्रश्नों और कुंजियों पर RMSNorm लागू करता है, और कुछ प्रयोगशालाएं ट्रिलियन-पैरामीटर पैमाने पर अतिरिक्त स्थिरता के लिए पूर्व और उत्तर-मानदंड ('सैंडविच' या 'पेरी-एलएन') को जोड़ती हैं। हार्डवेयर कर्नेल गति के लिए ऑपरेशन को फ़्यूज़ करते रहते हैं।

वास्तविक विश्व कार्यान्वयन

LLaMA, मिस्ट्रल और क्वेन सभी प्रत्येक टोकन पर अनुमान विलंबता को कम करने के लिए LayerNorm को RMSNorm से प्रतिस्थापित करते हैं

प्री-एलएन जीपीटी-शैली मॉडल को सीखने की दर के वार्मअप के बिना प्रशिक्षित करने देता है जिसकी 2017 पोस्ट-एलएन ट्रांसफार्मर को आवश्यकता थी

QK-सामान्यीकरण बड़े मॉडलों में लॉग को विस्फोट से रोकने के लिए ध्यान संबंधी प्रश्नों और कुंजियों पर RMSNorm का उपयोग करता है

मोबाइल और एज ट्रांसफार्मर RMSNorm को अपनाते हैं क्योंकि माध्य और पूर्वाग्रह छोड़ने से मेमोरी ट्रैफ़िक कम हो जाता है

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RMSNorm and Pre-Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is RMSNorm and Pre-Layer Normalization?

RMSNorm एक हल्की सामान्यीकरण परत है जो सक्रियणों को उनके मूल माध्य वर्ग के आधार पर पुन: मापती है, और प्री-लेयर सामान्यीकरण उन स्थानों को रखती है जो बाद के बजाय प्रत्येक उपपरत से पहले कदम रखते हैं। साथ में वे वार्मअप ट्रिक्स के बिना गहरे ट्रांसफार्मर को स्थिर रूप से प्रशिक्षित करते हैं।

मानक लेयरनॉर्म की तुलना में आरएमएसनॉर्म क्या छोड़ता है?

RMSNorm गणना करना और माध्य घटाना छोड़ देता है, केवल सक्रियणों के मूल माध्य वर्ग द्वारा सामान्यीकृत होता है।

RMSNorm प्रत्येक सक्रियण वेक्टर को किस मात्रा से विभाजित करता है?

RMSNorm वर्ग तत्वों के माध्य के वर्ग से विभाजित होता है, यानी मूल माध्य वर्ग, फिर सीखा हुआ लाभ लागू करता है।

पोस्ट-लेयर सामान्यीकरण की तुलना में प्री-लेयर सामान्यीकरण का मुख्य लाभ क्या है?

स्वच्छ अवशिष्ट पथ के साथ प्रत्येक उपपरत से पहले मानदंड रखने से ढाल परिमाण सीमित हो जाता है, जिससे सीखने की दर वार्मअप की आवश्यकता दूर हो जाती है।

प्री-एलएन ब्लॉक में, सामान्यीकरण परत जानबूझकर किस पथ को अछूता छोड़ देती है?

प्री-एलएन एक सबलेयर में इनपुट को सामान्य करता है लेकिन अवशिष्ट शॉर्टकट इसे बायपास कर देता है, जिससे एक स्वच्छ ढाल राजमार्ग संरक्षित होता है।

कौन से आधुनिक ओपन-वेट मॉडल परिवार डिफ़ॉल्ट रूप से RMSNorm का उपयोग करते हैं?

आरएमएसनॉर्म एलएलएएमए, मिस्ट्रल, क्वेन, जेम्मा और सबसे हाल के एलएलएम में मानक सामान्यीकरण बन गया।