क्या हुआ?
शोधकर्ताओं ने पज़लकेवी का प्रस्ताव दिया है, जो लंबे-संदर्भ वाले बड़े भाषा मॉडल अनुमान के दौरान उपयोग किए जाने वाले कुंजी-मूल्य कैश को संपीड़ित करने के लिए एक पृष्ठ-वार निम्न-रैंक अपघटन विधि है। पेपर का कहना है कि इसके प्रयोगों ने भंडारण को काफी हद तक कम करते हुए अधिकांश मापे गए पूर्ण केवी प्रदर्शन को बरकरार रखा।
24 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, बड़े भाषा मॉडल में लंबे-संदर्भ अनुमान के दौरान पूर्व टोकन को बनाए रखने के लिए आवश्यक मेमोरी को संबोधित करता है। वह रखी गई जानकारी कुंजी-मूल्य, या केवी, कैश में संग्रहीत की जाती है। लेखक केवी-कैश संपीड़न को पीढ़ी के दौरान उनका उपयोग जारी रखते हुए उन पिछले टोकन की भंडारण लागत को कम करने के एक तरीके के रूप में वर्णित करते हैं। स्रोत कैश-मेमोरी समस्या को अधिक सामान्य तकनीक के द्वितीयक अनुप्रयोग के बजाय कार्य के लिए केंद्रीय प्रेरणा के रूप में प्रस्तुत करता है।
पज़लकेवी प्रत्येक प्रति-सिर केवी कैश को निश्चित-लंबाई वाले तार्किक पृष्ठों में विभाजित करता है और प्रत्येक पूर्ण पृष्ठ को एक स्वतंत्र संपीड़न इकाई के रूप में मानता है। लेखकों का कहना है कि उन्होंने अलग-अलग पृष्ठों के भीतर पर्याप्त निम्न-रैंक संरचना देखी, जिसका अर्थ है कि किसी पृष्ठ में जानकारी को कम आयामों में दर्शाया जा सकता है। विधि प्रत्येक मॉडल परत और केवी हेड के भीतर पृष्ठों को अलग-अलग विघटित करती है। इसके बाद यह सीधे असम्पीडित, या घने, पृष्ठों और संपीड़ित, या फ़ैक्टराइज़्ड, दोनों पृष्ठों पर ध्यान की गणना करता है। ऑटोरेग्रेसिव डिकोडिंग के दौरान, नए पात्र पृष्ठ क्रमिक रूप से संपीड़ित होते हैं। पेपर इस दृष्टिकोण को प्रशिक्षण-मुक्त और अंशांकन-मुक्त बताता है।
लेखक मिलान किए गए भंडारण बजट के तहत मॉडल, संदर्भ लंबाई और बेंचमार्क में प्रयोगों की रिपोर्ट करते हैं। वे कहते हैं कि मूल केवी-कैश भंडारण के लगभग 60% पर, पज़लकेवी ने मूल्यांकन किए गए मॉडल और सभी बेंचमार्क सेटिंग्स दोनों में 96% से अधिक पूर्ण केवी प्रदर्शन हासिल किया। वे रूलर पर ग्लोबल एसवीडी और लॉन्गबेंच पर प्रतिस्पर्धी प्रदर्शन पर पर्याप्त लाभ की भी रिपोर्ट करते हैं। अधिक आक्रामक कमी के लिए, पेपर पज़लकेवी को परिमाणीकरण के साथ जोड़ता है और मूल भंडारण के 18.7% का उपयोग करके 93% से अधिक पूर्ण केवी प्रदर्शन की रिपोर्ट करता है। स्रोत आपूर्ति किए गए पाठ में मॉडल नाम, व्यक्तिगत बेंचमार्क स्कोर, रनटाइम माप या हार्डवेयर कॉन्फ़िगरेशन प्रदान नहीं करता है।
कुल मिलाकर, विवरण में कैश प्रतिनिधित्व, पृष्ठ-वार अपघटन, ध्यान गणना और रिपोर्ट किए गए भंडारण बिंदु शामिल हैं। यह आपूर्ति किए गए खाते की सीमाओं की भी पहचान करता है: स्रोत बेंचमार्क नाम और समग्र प्रदर्शन तुलना देता है, जबकि मॉडल नाम, विस्तृत स्कोर, रनटाइम माप और हार्डवेयर कॉन्फ़िगरेशन अनिर्दिष्ट रहते हैं।
यह क्यों मायने रखता है?
केवी-कैश मेमोरी लंबे-संदर्भ अनुमान को सीमित कर सकती है। यदि रिपोर्ट किए गए परिणाम पेपर के मूल्यांकन से परे हैं, तो पृष्ठ-वार संपीड़न मेमोरी आवश्यकताओं को कम कर सकता है और निश्चित भंडारण बजट के तहत लंबे संदर्भ को अधिक व्यावहारिक बना सकता है।
व्यावहारिक मुद्दा संदर्भ की लंबाई और स्मृति के बीच एक समझौता है। एक बड़ा केवी कैश पहले के टोकन से अधिक जानकारी को संरक्षित करता है, लेकिन यह अनुमान के दौरान भंडारण आवश्यकताओं को भी बढ़ाता है। इसलिए उस कैश को संपीड़ित करने से यह प्रभावित हो सकता है कि एक सिस्टम एक निश्चित मेमोरी बजट के भीतर कितने संदर्भ को संभाल सकता है। पज़लकेवी एक नए प्रशिक्षित मॉडल की आवश्यकता के बजाय कैश के पूर्ण भागों के प्रतिनिधित्व को कम करके सीधे उस बाधा को लक्षित करता है।
पेपर के रिपोर्ट किए गए परिणाम संभावित रूप से उपयोगी हैं क्योंकि वे दो अलग-अलग भंडारण बिंदुओं पर प्रदर्शन का वर्णन करते हैं। पहला पेपर के 96% से अधिक पूर्ण केवी संदर्भ प्रदर्शन को मूल भंडारण के लगभग 60% पर बरकरार रखता है। दूसरा प्रस्तावित अपघटन को परिमाणीकरण के साथ जोड़ता है और मूल भंडारण के 18.7% पर 93% से अधिक की रिपोर्ट करता है। यदि ये परिणाम सामान्यीकृत होते हैं, तो दृष्टिकोण ऑपरेटरों को लंबे-संदर्भ मॉडल की सेवा करते समय आउटपुट गुणवत्ता के मुकाबले मेमोरी खपत को संतुलित करने का एक और तरीका दे सकता है।
पृष्ठ-वार डिज़ाइन स्रोत में वर्णित पूर्व दृष्टिकोणों से पेपर का मुख्य तकनीकी अंतर भी है। वे दृष्टिकोण मॉडल भार, अंशांकन सक्रियण या व्यापक कैश क्षेत्र पर साझा आधार से प्राप्त निश्चित प्रक्षेपण स्थानों का उपयोग करते हैं। इसके बजाय पज़लकेवी मानता है कि छोटे कैश क्षेत्रों में उपयोगी स्थानीय संरचना हो सकती है और उन्हें स्वतंत्र रूप से संपीड़ित किया जा सकता है। यह प्रतिनिधित्व को स्थानीय भिन्नता के प्रति अधिक प्रतिक्रियाशील बना सकता है, लेकिन आपूर्ति किया गया स्रोत केवल लेखकों के प्रयोगों की रिपोर्ट करता है। यह स्थापित नहीं करता है कि विधि सभी मॉडल आर्किटेक्चर और वर्कलोड में व्यापक रूप से बेहतर, उत्पादन-तैयार या फायदेमंद है।
परिणाम की व्याख्या के लिए वह अंतर मायने रखता है। रिपोर्ट किए गए प्रतिशत बताए गए भंडारण बजट के तहत पूर्ण केवी के साथ पेपर की तुलना का वर्णन करते हैं; वे, आपूर्ति किए गए स्रोत में, परिनियोजन के बारे में प्रत्येक प्रश्न का उत्तर नहीं देते हैं या प्रत्येक मॉडल और कार्यभार के लिए कोई परिणाम स्थापित नहीं करते हैं। इसलिए संभावित मूल्य इस बात से जुड़ा है कि रिपोर्ट की गई स्मृति और प्रदर्शन संबंध व्यवहार में उपयोगी रहता है या नहीं।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
पेपर एक संस्करण-एक arXiv प्रीप्रिंट है, और स्रोत मूल्यांकन किए गए मॉडल, हार्डवेयर, विलंबता प्रभाव, कार्यान्वयन उपलब्धता, या स्वतंत्र प्रतिकृति की पहचान नहीं करता है। वे विवरण यह निर्धारित करेंगे कि रिपोर्ट किए गए भंडारण लाभ व्यावहारिक सेवा लाभों में परिवर्तित होते हैं या नहीं।
सबसे महत्वपूर्ण अगला प्रश्न यह है कि क्या रिपोर्ट किया गया प्रदर्शन पेपर की बताई गई सेटिंग्स के बाहर मूल्यांकन में टिक पाता है। स्रोत का नाम RULER और LongBench है और कहता है कि प्रयोग दो मॉडल, एकाधिक संदर्भ लंबाई और बेंचमार्क सेटिंग्स को कवर करते हैं, लेकिन यह मॉडल की पहचान नहीं करता है या प्रति-कार्य परिणाम नहीं दिखाता है। पाठकों को यह जानने के लिए उन विवरणों की आवश्यकता होगी कि मॉडल आर्किटेक्चर, ध्यान लेआउट, अनुक्रम लंबाई और कार्य प्रकार के प्रति विधि कितनी संवेदनशील है।
भंडारण में कमी कम सेवा लागत या तेज़ अनुमान के समान नहीं है। आपूर्ति किया गया पाठ विलंबता, थ्रूपुट, मेमोरी बैंडविड्थ, ऊर्जा उपयोग, डीकंप्रेसन ओवरहेड या हार्डवेयर जिस पर प्रयोग चला, की रिपोर्ट नहीं करता है। क्योंकि पज़लकेवी सघन और तथ्यात्मक दोनों पृष्ठों पर ध्यान की गणना करता है और पृष्ठों को क्रमिक रूप से संपीड़ित करता है, कार्यान्वयन विवरण प्रभावित कर सकता है कि मेमोरी बचत शुद्ध परिचालन लाभ उत्पन्न करती है या नहीं। तैनाती अर्थशास्त्र के बारे में दावों में पेपर के भंडारण दावों का अनुवाद करने से पहले वे माप आवश्यक हैं।
मात्राबद्ध परिणाम भी अलग जांच की गारंटी देता है। जब परिमाणीकरण जोड़ा जाता है तो पेपर मूल भंडारण के 18.7% पर 93% से अधिक पूर्ण केवी प्रदर्शन की रिपोर्ट करता है, लेकिन स्रोत परिमाणीकरण योजना, परिशुद्धता, त्रुटि वितरण या परिणाम कार्यों पर समान रूप से लागू होता है या नहीं, यह निर्दिष्ट नहीं करता है। प्रीप्रिंट को संस्करण एक के रूप में पहचाना गया है और आपूर्ति किए गए स्रोत में इसे स्वतंत्र रूप से मान्य नहीं किया गया है। कोड रिलीज़, अन्य कैश-संपीड़न विधियों के साथ व्यापक तुलना और अतिरिक्त मॉडलों पर प्रतिकृति विधि की व्यावहारिक पहुंच और सीमाओं को स्पष्ट करेगी।
आगे के साक्ष्य पेपर के समग्र परिणामों को वास्तविक उपयोग से जोड़ देंगे। विशेष रूप से, गायब मॉडल पहचान, प्रति-कार्य परिणाम, सिस्टम माप, परिमाणीकरण विवरण, कोड और स्वतंत्र प्रतिकृति यह खुला छोड़ देते हैं कि सेवा के लिए महत्वपूर्ण सेटिंग्स में विधि कितनी लगातार व्यवहार करती है। कार्य विकसित होने पर वे चूकें पालन की जाने वाली मुख्य बातें हैं।