तकनीकी गाइड

परत सामान्यीकरण

परत सामान्यीकरण प्रत्येक व्यक्तिगत उदाहरण के भीतर सक्रियणों को पुन: स्केल करके प्रशिक्षण को स्थिर करता है ताकि उनके पास शून्य माध्य और इकाई भिन्नता हो।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It is a quiet but essential ingredient that makes deep transformers trainable.

गहरा गोता

2016 में बा, किरोस और हिंटन द्वारा पेश किया गया, परत सामान्यीकरण (लेयरनॉर्म) इस समस्या का समाधान करता है कि एक गहरे नेटवर्क के अंदर सक्रियण बेतहाशा अलग-अलग पैमाने पर जा सकते हैं क्योंकि सिग्नल कई परतों से गुजरते हैं, सीखने को धीमा या अस्थिर करते हैं। बैच सामान्यीकरण के विपरीत, जो एक मिनी-बैच में उदाहरणों में प्रत्येक सुविधा को सामान्य बनाता है, लेयरनॉर्म एकल उदाहरण की सुविधाओं में सामान्यीकृत होता है। यह इसे बैच आकार से स्वतंत्र बनाता है और प्रशिक्षण और अनुमान में समान रूप से प्रयोग करने योग्य बनाता है, और यह स्वाभाविक रूप से चर-लंबाई अनुक्रमों के साथ काम करता है, यही कारण है कि यह आधुनिक भाषा मॉडल को शक्ति देने वाले ट्रांसफार्मर के लिए मानक बन गया है। सामान्य होने के बाद, यह एक सीखने योग्य स्केल (गामा) और शिफ्ट (बीटा) लागू करता है ताकि नेटवर्क अपनी जरूरत के किसी भी प्रतिनिधित्व को पुनर्प्राप्त कर सके।

तकनीकी अंतर्दृष्टि

एक फीचर वेक्टर x के लिए, लेयरनॉर्म उस वेक्टर के तत्वों पर माध्य और विचरण की गणना करता है, फिर गामा * (x - माध्य) / sqrt (विचरण + एप्सिलॉन) + बीटा आउटपुट करता है। चूँकि आँकड़े एक ही नमूने से आते हैं, व्यवहार समान होता है चाहे बैच में 1 या 1000 उदाहरण हों। एक सरल संस्करण, RMSNorm, स्किप माध्य घटाव और केवल मूल-माध्य-वर्ग द्वारा विभाजित करता है, जिससे गणना बचती है; इसका उपयोग लामा जैसे मॉडलों में किया जाता है। प्लेसमेंट भी मायने रखता है: 'प्री-नॉर्म' (प्रत्येक सबलेयर से पहले सामान्यीकरण) गहरे ट्रांसफार्मर को 'पोस्ट-नॉर्म' की तुलना में प्रशिक्षित करना बहुत आसान बनाता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

परत सामान्यीकरण का भविष्य

बड़े पैमाने पर दक्षता के लिए सामान्यीकरण को सुव्यवस्थित किया जा रहा है। RMSNorm ने बड़े पैमाने पर नए बड़े भाषा मॉडलों में LayerNorm को प्रतिस्थापित कर दिया है क्योंकि यह सस्ता है और साथ ही काम भी करता है, और प्री-नॉर्म प्लेसमेंट अब बहुत गहरे स्टैक के लिए डिफ़ॉल्ट है। शोधकर्ता सामान्यीकरण-मुक्त आर्किटेक्चर की खोज जारी रखते हैं जो सामान्यीकरण द्वारा प्रदान की जाने वाली प्रशिक्षण स्थिरता को बनाए रखते हुए ओवरहेड में कटौती करने के उद्देश्य से सावधानीपूर्वक आरंभीकरण या स्केलिंग ट्रिक्स का उपयोग करते हैं।

वास्तविक विश्व कार्यान्वयन

GPT और BERT जैसे भाषा मॉडल में प्रत्येक ट्रांसफार्मर ब्लॉक को स्थिर करना।

लामा-परिवार मॉडल के अंदर हल्के सामान्यीकरण विकल्प के रूप में RMSNorm को सक्षम करना।

भाषण और अनुवाद मॉडल में चर-लंबाई अनुक्रम डेटा को सामान्य करना जहां बैच आकार भिन्न होते हैं।

एक बैच के आकार के साथ विश्वसनीय प्रशिक्षण की अनुमति देना, जैसे कि कुछ सुदृढीकरण शिक्षण सेटअप में।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

आरएमएसनॉर्म और प्री-लेयर सामान्यीकरण

अक्सर पूछे जाने वाले प्रश्नों

What is Layer Normalization?

परत सामान्यीकरण प्रत्येक व्यक्तिगत उदाहरण के भीतर सक्रियणों को पुन: स्केल करके प्रशिक्षण को स्थिर करता है ताकि उनके पास शून्य माध्य और इकाई भिन्नता हो। यह एक शांत लेकिन आवश्यक घटक है जो गहरे ट्रांसफार्मर को प्रशिक्षित करने योग्य बनाता है।

परत सामान्यीकरण इसके माध्य और विचरण की गणना किससे करता है?

लेयरनॉर्म एक व्यक्तिगत नमूने के फीचर आयामों को सामान्यीकृत करता है, जिससे यह बैच में अन्य उदाहरणों से स्वतंत्र हो जाता है।

ट्रांसफार्मर में बैच सामान्यीकरण की तुलना में परत सामान्यीकरण को प्राथमिकता क्यों दी जाती है?

क्योंकि इसके आँकड़े एक ही उदाहरण से आते हैं, लेयरनॉर्म बैच आकार की परवाह किए बिना लगातार व्यवहार करता है और चर-लंबाई वाले पाठ अनुक्रमों के अनुरूप होता है।

सीखने योग्य पैरामीटर गामा और बीटा लेयरनॉर्म को क्या करने देते हैं?

शून्य माध्य और इकाई विचरण को सामान्य करने के बाद, गामा स्केल और बीटा परिणाम को बदल देते हैं ताकि मॉडल को एक निश्चित वितरण में मजबूर न किया जाए।

RMSNorm मानक LayerNorm से किस प्रकार भिन्न है?

RMSNorm सक्रियणों के मूल-माध्य-वर्ग द्वारा माध्य-केंद्रित चरण और पैमानों को छोड़ देता है, जो सस्ता है और लामा जैसे मॉडलों में उपयोग किया जाता है।

परत सामान्यीकरण मुख्य रूप से गहरे नेटवर्क में किस समस्या को हल करने में मदद करता है?

जैसे ही सिग्नल कई परतों से गुजरते हैं, उनका स्केल उड़ सकता है या सिकुड़ सकता है; सामान्यीकरण सक्रियता को स्थिर सीमा में रखता है इसलिए ग्रेडिएंट अच्छा व्यवहार करते हैं।