भाषा एआई गाइड

YaRN संदर्भ विंडो स्केलिंग

YaRN (फिर भी एक और RoPE extensioN) एक ऐसी तकनीक है जो न्यूनतम फाइन-ट्यूनिंग के साथ एक ट्रांसफार्मर की प्रयोग करने योग्य संदर्भ विंडो को उस चीज़ से कहीं आगे तक फैलाती है जिस पर उसे प्रशिक्षित किया गया था।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it lets existing models handle much longer documents without retraining from scratch.

गहरा गोता

अधिकांश आधुनिक एलएलएम रोटरी पोजीशन एंबेडिंग (आरओपीई) का उपयोग करके शब्द स्थितियों को एन्कोड करते हैं, जो प्रशिक्षण के दौरान मॉडल द्वारा देखी गई लंबाई तक ही अच्छी तरह से काम करता है। लंबे क्रम में फ़ीड करें और मॉडल बुरी तरह खराब हो जाता है। YaRN आवृत्ति-जागरूक तरीके से RoPE की रोटेशन आवृत्तियों को पुन: स्केल करके इसे हल करता है: उच्च-आवृत्ति आयाम (जो स्थानीय, आस-पास के रिश्तों को कैप्चर करते हैं) को ज्यादातर अछूता छोड़ दिया जाता है, जबकि कम-आवृत्ति आयाम (जो लंबी दूरी की स्थिति को कैप्चर करते हैं) को प्रक्षेपित किया जाता है। यह लंबी दूरी पर लॉग को अच्छी तरह से व्यवहार में रखने के लिए ध्यान में तापमान समायोजन भी जोड़ता है। एलएलएएमए मॉडल पर प्रदर्शित परिणाम, मूल प्रशिक्षण डेटा के केवल 0.1% और कुछ सौ फ़ाइन-ट्यूनिंग चरणों का उपयोग करके संदर्भ को 4K से 64K-128K टोकन तक विस्तारित करता है।

तकनीकी अंतर्दृष्टि

RoPE स्थिति और प्रति-आयाम आवृत्ति के आनुपातिक कोण द्वारा क्वेरी और कुंजी वैक्टर को घुमाता है। नाइव लीनियर इंटरपोलेशन (पोजीशन इंटरपोलेशन) सभी आवृत्तियों को समान रूप से कुचल देता है, जिससे स्थानीय विवरण को नुकसान पहुंचता है। इसके बजाय YaRN 'NTK-बाय-पार्ट्स' लागू करता है: यह केवल कम-आवृत्ति (लंबी-तरंग दैर्ध्य) आयामों को प्रक्षेपित करता है, उच्च-आवृत्ति वाले को अकेला छोड़ देता है, और उनके बीच रैंप बनाता है। ध्यान तापमान का स्केलिंग एन्ट्रापी बदलाव की भरपाई करता है, विस्तारित लंबाई पर सटीकता को संरक्षित करता है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

YaRN संदर्भ विंडो स्केलिंग का भविष्य

YaRN-शैली आवृत्ति-जागरूक एक्सटेंशन लंबे-संदर्भ मॉडल की शिपिंग के लिए एक डिफ़ॉल्ट घटक बन गया है; जैसे-जैसे प्रयोगशालाएँ मिलियन-टोकन विंडो की ओर बढ़ती हैं, वेरिएंट और उत्तराधिकारी सामने आते रहते हैं। कुशल ध्यान, केवी-कैश संपीड़न और गतिशील स्केलिंग के साथ सख्त एकीकरण की अपेक्षा करें जो प्रति अनुरोध तुरंत समायोजित हो जाता है। व्यापक प्रवृत्ति 'किसी मॉडल को कितनी देर तक प्रशिक्षित किया गया था' को 'कितनी देर तक वह उपयोगी ढंग से पढ़ सकता है' से अलग कर रही है, जिससे लंबे संदर्भ को महंगी वास्तुशिल्प प्रतिबद्धता के बजाय एक सस्ता प्रशिक्षण उपरांत सुविधा बना दिया गया है।

वास्तविक विश्व कार्यान्वयन

एक खुले LLaMA मॉडल को 4K से 128K टोकन तक विस्तारित करना ताकि यह एक बार में संपूर्ण कोडबेस या लंबे अनुबंध को ग्रहण कर सके

किसी चैटबॉट को पहले के वार्तालापों को काटे बिना बहुत लंबे वार्तालाप इतिहास को बनाए रखने देना

आधार मॉडल की मूल विंडो से अधिक पुस्तक-लंबाई वाले दस्तावेज़ों या बहु-घंटे प्रतिलेखों का सारांश

केवल एक छोटे से फाइन-ट्यूनिंग रन का उपयोग करके लंबे-संदर्भ पुनर्प्राप्ति कार्यों के लिए पूर्व-प्रशिक्षित मॉडल को सस्ते में अपनाना

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is YaRN Context Window Scaling?

YaRN (फिर भी एक और RoPE extensioN) एक ऐसी तकनीक है जो न्यूनतम फाइन-ट्यूनिंग के साथ एक ट्रांसफार्मर की प्रयोग करने योग्य संदर्भ विंडो को उस चीज़ से कहीं आगे तक फैलाती है जिस पर उसे प्रशिक्षित किया गया था। यह महत्वपूर्ण है क्योंकि यह मौजूदा मॉडलों को स्क्रैच से दोबारा प्रशिक्षित किए बिना अधिक लंबे दस्तावेज़ों को संभालने की सुविधा देता है।

संदर्भ लंबाई बढ़ाने के लिए YaRN किस स्थिति-एन्कोडिंग योजना को संशोधित करता है?

YaRN का अर्थ 'Yet another RoPE extensioN' है और यह रोटरी पोजीशन एंबेडिंग में उपयोग की जाने वाली रोटेशन आवृत्तियों को पुन: स्केल करके काम करता है।

YaRN उच्च-आवृत्ति बनाम निम्न-आवृत्ति RoPE आयामों का इलाज कैसे करता है?

YaRN का 'एनटीके-बाय-पार्ट्स' दृष्टिकोण उच्च-आवृत्ति (स्थानीय) आयामों को संरक्षित करता है जबकि स्थानीय विवरण को नुकसान पहुंचाने से बचने के लिए कम-आवृत्ति (लंबी दूरी) वाले आयामों को प्रक्षेपित करता है।

शुरुआत से ही एक लंबे-संदर्भ मॉडल को प्रशिक्षित करने की तुलना में YaRN का मुख्य दक्षता लाभ क्या है?

YaRN मूल प्रशिक्षण डेटा के लगभग 0.1% और फ़ाइन-ट्यूनिंग चरणों की एक छोटी संख्या का उपयोग करके संदर्भ का विस्तार कर सकता है, जो पुनः प्रशिक्षण की तुलना में कहीं सस्ता है।

आवृत्तियों को पुनः स्केल करने के अलावा, लंबी दूरी के ध्यान को स्थिर रखने के लिए YaRN क्या अतिरिक्त समायोजन लागू करता है?

YaRN एन्ट्रापी/लॉगिट शिफ्ट की भरपाई के लिए ध्यान तापमान को संशोधित करता है जो तब होता है जब अनुक्रम बहुत लंबा हो जाता है।

यदि आप RoPE मॉडल अनुक्रमों को बिना किसी स्केलिंग के प्रशिक्षित किए गए समय से अधिक समय तक फ़ीड करते हैं तो क्या समस्या होती है?

RoPE अनदेखी लंबी स्थितियों के लिए खराब सामान्यीकरण करता है, इसलिए जब तक आवृत्तियों को पुन: स्केल नहीं किया जाता है, तब तक गुणवत्ता गिर जाती है।