YaRN संदर्भ विंडो स्केलिंग
YaRN (फिर भी एक और RoPE extensioN) एक ऐसी तकनीक है जो न्यूनतम फाइन-ट्यूनिंग के साथ एक ट्रांसफार्मर की प्रयोग करने योग्य संदर्भ विंडो को उस चीज़ से कहीं आगे तक फैलाती है जिस पर उसे प्रशिक्षित किया गया था।
सिंहावलोकन
It matters because it lets existing models handle much longer documents without retraining from scratch.
गहरा गोता
अधिकांश आधुनिक एलएलएम रोटरी पोजीशन एंबेडिंग (आरओपीई) का उपयोग करके शब्द स्थितियों को एन्कोड करते हैं, जो प्रशिक्षण के दौरान मॉडल द्वारा देखी गई लंबाई तक ही अच्छी तरह से काम करता है। लंबे क्रम में फ़ीड करें और मॉडल बुरी तरह खराब हो जाता है। YaRN आवृत्ति-जागरूक तरीके से RoPE की रोटेशन आवृत्तियों को पुन: स्केल करके इसे हल करता है: उच्च-आवृत्ति आयाम (जो स्थानीय, आस-पास के रिश्तों को कैप्चर करते हैं) को ज्यादातर अछूता छोड़ दिया जाता है, जबकि कम-आवृत्ति आयाम (जो लंबी दूरी की स्थिति को कैप्चर करते हैं) को प्रक्षेपित किया जाता है। यह लंबी दूरी पर लॉग को अच्छी तरह से व्यवहार में रखने के लिए ध्यान में तापमान समायोजन भी जोड़ता है। एलएलएएमए मॉडल पर प्रदर्शित परिणाम, मूल प्रशिक्षण डेटा के केवल 0.1% और कुछ सौ फ़ाइन-ट्यूनिंग चरणों का उपयोग करके संदर्भ को 4K से 64K-128K टोकन तक विस्तारित करता है।
तकनीकी अंतर्दृष्टि
RoPE स्थिति और प्रति-आयाम आवृत्ति के आनुपातिक कोण द्वारा क्वेरी और कुंजी वैक्टर को घुमाता है। नाइव लीनियर इंटरपोलेशन (पोजीशन इंटरपोलेशन) सभी आवृत्तियों को समान रूप से कुचल देता है, जिससे स्थानीय विवरण को नुकसान पहुंचता है। इसके बजाय YaRN 'NTK-बाय-पार्ट्स' लागू करता है: यह केवल कम-आवृत्ति (लंबी-तरंग दैर्ध्य) आयामों को प्रक्षेपित करता है, उच्च-आवृत्ति वाले को अकेला छोड़ देता है, और उनके बीच रैंप बनाता है। ध्यान तापमान का स्केलिंग एन्ट्रापी बदलाव की भरपाई करता है, विस्तारित लंबाई पर सटीकता को संरक्षित करता है।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
YaRN संदर्भ विंडो स्केलिंग का भविष्य
YaRN-शैली आवृत्ति-जागरूक एक्सटेंशन लंबे-संदर्भ मॉडल की शिपिंग के लिए एक डिफ़ॉल्ट घटक बन गया है; जैसे-जैसे प्रयोगशालाएँ मिलियन-टोकन विंडो की ओर बढ़ती हैं, वेरिएंट और उत्तराधिकारी सामने आते रहते हैं। कुशल ध्यान, केवी-कैश संपीड़न और गतिशील स्केलिंग के साथ सख्त एकीकरण की अपेक्षा करें जो प्रति अनुरोध तुरंत समायोजित हो जाता है। व्यापक प्रवृत्ति 'किसी मॉडल को कितनी देर तक प्रशिक्षित किया गया था' को 'कितनी देर तक वह उपयोगी ढंग से पढ़ सकता है' से अलग कर रही है, जिससे लंबे संदर्भ को महंगी वास्तुशिल्प प्रतिबद्धता के बजाय एक सस्ता प्रशिक्षण उपरांत सुविधा बना दिया गया है।
वास्तविक विश्व कार्यान्वयन
एक खुले LLaMA मॉडल को 4K से 128K टोकन तक विस्तारित करना ताकि यह एक बार में संपूर्ण कोडबेस या लंबे अनुबंध को ग्रहण कर सके
किसी चैटबॉट को पहले के वार्तालापों को काटे बिना बहुत लंबे वार्तालाप इतिहास को बनाए रखने देना
आधार मॉडल की मूल विंडो से अधिक पुस्तक-लंबाई वाले दस्तावेज़ों या बहु-घंटे प्रतिलेखों का सारांश
केवल एक छोटे से फाइन-ट्यूनिंग रन का उपयोग करके लंबे-संदर्भ पुनर्प्राप्ति कार्यों के लिए पूर्व-प्रशिक्षित मॉडल को सस्ते में अपनाना
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
प्रसंग विंडोज़
अक्सर पूछे जाने वाले प्रश्नों
What is YaRN Context Window Scaling?
YaRN (फिर भी एक और RoPE extensioN) एक ऐसी तकनीक है जो न्यूनतम फाइन-ट्यूनिंग के साथ एक ट्रांसफार्मर की प्रयोग करने योग्य संदर्भ विंडो को उस चीज़ से कहीं आगे तक फैलाती है जिस पर उसे प्रशिक्षित किया गया था। यह महत्वपूर्ण है क्योंकि यह मौजूदा मॉडलों को स्क्रैच से दोबारा प्रशिक्षित किए बिना अधिक लंबे दस्तावेज़ों को संभालने की सुविधा देता है।
संदर्भ लंबाई बढ़ाने के लिए YaRN किस स्थिति-एन्कोडिंग योजना को संशोधित करता है?
YaRN का अर्थ 'Yet another RoPE extensioN' है और यह रोटरी पोजीशन एंबेडिंग में उपयोग की जाने वाली रोटेशन आवृत्तियों को पुन: स्केल करके काम करता है।
YaRN उच्च-आवृत्ति बनाम निम्न-आवृत्ति RoPE आयामों का इलाज कैसे करता है?
YaRN का 'एनटीके-बाय-पार्ट्स' दृष्टिकोण उच्च-आवृत्ति (स्थानीय) आयामों को संरक्षित करता है जबकि स्थानीय विवरण को नुकसान पहुंचाने से बचने के लिए कम-आवृत्ति (लंबी दूरी) वाले आयामों को प्रक्षेपित करता है।
शुरुआत से ही एक लंबे-संदर्भ मॉडल को प्रशिक्षित करने की तुलना में YaRN का मुख्य दक्षता लाभ क्या है?
YaRN मूल प्रशिक्षण डेटा के लगभग 0.1% और फ़ाइन-ट्यूनिंग चरणों की एक छोटी संख्या का उपयोग करके संदर्भ का विस्तार कर सकता है, जो पुनः प्रशिक्षण की तुलना में कहीं सस्ता है।
आवृत्तियों को पुनः स्केल करने के अलावा, लंबी दूरी के ध्यान को स्थिर रखने के लिए YaRN क्या अतिरिक्त समायोजन लागू करता है?
YaRN एन्ट्रापी/लॉगिट शिफ्ट की भरपाई के लिए ध्यान तापमान को संशोधित करता है जो तब होता है जब अनुक्रम बहुत लंबा हो जाता है।
यदि आप RoPE मॉडल अनुक्रमों को बिना किसी स्केलिंग के प्रशिक्षित किए गए समय से अधिक समय तक फ़ीड करते हैं तो क्या समस्या होती है?
RoPE अनदेखी लंबी स्थितियों के लिए खराब सामान्यीकरण करता है, इसलिए जब तक आवृत्तियों को पुन: स्केल नहीं किया जाता है, तब तक गुणवत्ता गिर जाती है।