तकनीकी गाइड

YaRN और संदर्भ लंबाई विस्तार

YaRN (फिर भी एक और RoPE extensioN) एक मॉडल की प्रयोग करने योग्य संदर्भ विंडो को जिस पर प्रशिक्षित किया गया था उससे कहीं आगे बढ़ाने के लिए एक कुशल तकनीक है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

गहरा गोता

अधिकांश आधुनिक एलएलएम टोकन स्थितियों को RoPE (रोटरी पोजीशन एंबेडिंग) के साथ एन्कोड करते हैं, जो स्थिति से जुड़े कोणों द्वारा क्वेरी और कुंजी वैक्टर को घुमाते हैं। जब आप प्रशिक्षण की लंबाई से अधिक लंबे अनुक्रम फ़ीड करते हैं, तो ये घुमाव अनदेखी श्रेणियों में प्रवेश करते हैं और मॉडल टूट जाता है। बोवेन पेंग और सहयोगियों द्वारा 2023 में पेश किया गया YaRN, प्रति आवृत्ति पर लागू एनटीके-जागरूक इंटरपोलेशन के साथ इसे ठीक करता है: यह उच्च-आवृत्ति आयामों (जो स्थानीय, छोटी दूरी के संबंधों को कैप्चर करता है) को ज्यादातर अछूता छोड़ देता है, जबकि कम-आवृत्ति आयामों (जो लंबी दूरी की स्थिति को ट्रैक करता है) को इंटरपोल करता है। YaRN लंबे संदर्भों से आने वाले एन्ट्रापी परिवर्तनों का मुकाबला करने के लिए ध्यान में तापमान समायोजन भी जोड़ता है। डेटा के केवल एक छोटे से हिस्से और सरल दृष्टिकोण की आवश्यकता वाले चरणों पर फाइन-ट्यूनिंग के बाद परिणाम मजबूत दीर्घकालिक-संदर्भ प्रदर्शन है।

तकनीकी अंतर्दृष्टि

RoPE प्रत्येक एम्बेडिंग आयाम को एक रोटेशन आवृत्ति निर्दिष्ट करता है। अनुभवहीन रैखिक प्रक्षेप सभी आवृत्तियों को समान रूप से संपीड़ित करता है, उच्च-आवृत्ति आयामों को नुकसान पहुँचाता है जो बारीक स्थानीय विवरण को एन्कोड करते हैं। YaRN उच्च-आवृत्ति वाले को संरक्षित करते हुए केवल कम-आवृत्ति (लंबी-तरंग दैर्ध्य) आयामों को प्रक्षेपित करने के लिए एक रैंप फ़ंक्शन का उपयोग करता है, साथ ही 1/sqrt(t) ध्यान तापमान स्केलिंग जो अनुक्रम लंबाई बढ़ने पर सॉफ्टमैक्स तीखेपन को स्थिर रखता है। यह एनटीके-बाय-पार्ट्स दृष्टिकोण बहुत कम गिरावट के साथ संदर्भ का विस्तार करता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

YaRN का भविष्य और संदर्भ लंबाई विस्तार

संदर्भ विस्तार अब मानक अभ्यास है: खुले मॉडल नियमित रूप से 128K टोकन या उससे अधिक तक पहुंचने वाले YaRN-विस्तारित वेरिएंट को शिप करते हैं। अनुसंधान उन तरीकों की ओर बढ़ रहा है जो शून्य या लगभग-शून्य फ़ाइन-ट्यूनिंग के साथ संदर्भ का विस्तार करते हैं, RoPE रीस्केलिंग को ध्यान-पैटर्न ट्रिक्स के साथ जोड़ते हैं, और केवल सिरों के बजाय पूरी विंडो में गुणवत्ता बनाए रखते हैं। पूर्व-प्रशिक्षण में इन तकनीकों के सख्त एकीकरण की अपेक्षा करें ताकि लंबे संदर्भ को रेट्रोफिटेड के बजाय मूल बनाया जा सके।

वास्तविक विश्व कार्यान्वयन

संक्षिप्त फ़ाइन-ट्यूनिंग के साथ लंबे दस्तावेज़ वाले प्रश्नों के उत्तर के लिए एक खुले 4K-संदर्भ मॉडल को 32K या 128K तक विस्तारित करना

पुनर्प्राप्ति-संवर्धित प्रणालियों को बिना किसी काट-छाँट के कई संयोजित मार्गों को समाहित करने में सक्षम बनाना

पावरिंग कोड सहायकों को एक संपूर्ण बड़ी रिपॉजिटरी फ़ाइल या एक प्रॉम्प्ट में एकाधिक फ़ाइलों की आवश्यकता होती है

लंबी मल्टी-टर्न बातचीत के लिए एक आधार मॉडल को अपनाना जो बड़े चैट इतिहास को संचित करता है

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

प्रसंग विस्तार के लिए स्थिति प्रक्षेप

अक्सर पूछे जाने वाले प्रश्नों

What is YaRN and Context Length Extension?

YaRN (फिर भी एक और RoPE extensioN) एक मॉडल की प्रयोग करने योग्य संदर्भ विंडो को जिस पर प्रशिक्षित किया गया था उससे कहीं आगे बढ़ाने के लिए एक कुशल तकनीक है। यह चतुराई से रोटरी स्थिति एम्बेडिंग को फिर से मापता है ताकि 4K टोकन पर प्रशिक्षित एक मॉडल न्यूनतम फाइन-ट्यूनिंग के साथ 32K या उससे अधिक को संभाल सके।

संदर्भ का विस्तार करने के लिए YaRN किस स्थिति-एन्कोडिंग विधि को संशोधित करता है?

YaRN, जिसके नाम का अर्थ है एक और RoPE एक्सटेंशन, अधिकांश आधुनिक एलएलएम में उपयोग की जाने वाली रोटरी स्थिति एम्बेडिंग को पुन: मापता है।

जब RoPE मॉडल अपनी प्रशिक्षण अवधि से अधिक लंबे अनुक्रम देखता है तो क्या गलत होता है?

प्रशिक्षण से परे स्थितियाँ ऐसे घूर्णन कोण उत्पन्न करती हैं जिन्हें मॉडल ने कभी नहीं देखा है, इसलिए ध्यान व्यवहार में तेजी से गिरावट आती है।

YaRN विभिन्न RoPE आवृत्ति आयामों का इलाज कैसे करता है?

YaRN एक NTK-बाय-पार्ट्स रैंप का उपयोग करता है जो लंबी-तरंग दैर्ध्य कम-आवृत्ति डिम को प्रक्षेपित करता है और छोटी दूरी की उच्च-आवृत्ति डिम को अधिकतर बरकरार रखता है।

आवृत्तियों को पुनः स्केल करने के अलावा, YaRN क्या अतिरिक्त समायोजन लागू करता है?

YaRN संदर्भ बढ़ने पर होने वाले एन्ट्रापी बदलावों का प्रतिकार करने के लिए ध्यान लॉग में तापमान स्केलिंग जोड़ता है।

अनुभवहीन प्रक्षेप की तुलना में YaRN का मुख्य व्यावहारिक लाभ क्या है?

आवश्यक डेटा के एक छोटे से हिस्से पर फाइन-ट्यूनिंग के बाद YaRN मजबूत दीर्घकालिक-संदर्भ गुणवत्ता प्राप्त करता है।