समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

पज़लकेवी एलएलएम केवी-कैश स्टोरेज को कम करने के लिए पृष्ठ-वार संपीड़न का प्रस्ताव करता है

एक नया arXiv पेपर पज़लकेवी का प्रस्ताव करता है, जो एक प्रशिक्षण- और अंशांकन-मुक्त विधि है जो बड़े भाषा मॉडल केवी कैश के पूर्ण पृष्ठों को स्वतंत्र रूप से संपीड़ित करता है। यह लगभग 60% मूल भंडारण पर 96% से अधिक पूर्ण केवी प्रदर्शन की रिपोर्ट करता है, और परिमाणीकरण के साथ 18.7% मूल भंडारण पर 93% से अधिक की रिपोर्ट करता है।

5 min readRead the primary source
Source-page capture accompanying PuzzleKV proposes page-wise compression to reduce LLM KV-cache storage
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.23843
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
परिमाणीकरण
मॉडल भार को 8-बिट या 4-बिट जैसे कम परिशुद्धता प्रारूपों में परिवर्तित करना।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ने पज़लकेवी का प्रस्ताव दिया है, जो लंबे-संदर्भ वाले बड़े भाषा मॉडल अनुमान के दौरान उपयोग किए जाने वाले कुंजी-मूल्य कैश को संपीड़ित करने के लिए एक पृष्ठ-वार निम्न-रैंक अपघटन विधि है। पेपर का कहना है कि इसके प्रयोगों ने भंडारण को काफी हद तक कम करते हुए अधिकांश मापे गए पूर्ण केवी प्रदर्शन को बरकरार रखा।

24 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, बड़े भाषा मॉडल में लंबे-संदर्भ अनुमान के दौरान पूर्व टोकन को बनाए रखने के लिए आवश्यक मेमोरी को संबोधित करता है। वह रखी गई जानकारी कुंजी-मूल्य, या केवी, कैश में संग्रहीत की जाती है। लेखक केवी-कैश संपीड़न को पीढ़ी के दौरान उनका उपयोग जारी रखते हुए उन पिछले टोकन की भंडारण लागत को कम करने के एक तरीके के रूप में वर्णित करते हैं। स्रोत कैश-मेमोरी समस्या को अधिक सामान्य तकनीक के द्वितीयक अनुप्रयोग के बजाय कार्य के लिए केंद्रीय प्रेरणा के रूप में प्रस्तुत करता है।

पज़लकेवी प्रत्येक प्रति-सिर केवी कैश को निश्चित-लंबाई वाले तार्किक पृष्ठों में विभाजित करता है और प्रत्येक पूर्ण पृष्ठ को एक स्वतंत्र संपीड़न इकाई के रूप में मानता है। लेखकों का कहना है कि उन्होंने अलग-अलग पृष्ठों के भीतर पर्याप्त निम्न-रैंक संरचना देखी, जिसका अर्थ है कि किसी पृष्ठ में जानकारी को कम आयामों में दर्शाया जा सकता है। विधि प्रत्येक मॉडल परत और केवी हेड के भीतर पृष्ठों को अलग-अलग विघटित करती है। इसके बाद यह सीधे असम्पीडित, या घने, पृष्ठों और संपीड़ित, या फ़ैक्टराइज़्ड, दोनों पृष्ठों पर ध्यान की गणना करता है। ऑटोरेग्रेसिव डिकोडिंग के दौरान, नए पात्र पृष्ठ क्रमिक रूप से संपीड़ित होते हैं। पेपर इस दृष्टिकोण को प्रशिक्षण-मुक्त और अंशांकन-मुक्त बताता है।

लेखक मिलान किए गए भंडारण बजट के तहत मॉडल, संदर्भ लंबाई और बेंचमार्क में प्रयोगों की रिपोर्ट करते हैं। वे कहते हैं कि मूल केवी-कैश भंडारण के लगभग 60% पर, पज़लकेवी ने मूल्यांकन किए गए मॉडल और सभी बेंचमार्क सेटिंग्स दोनों में 96% से अधिक पूर्ण केवी प्रदर्शन हासिल किया। वे रूलर पर ग्लोबल एसवीडी और लॉन्गबेंच पर प्रतिस्पर्धी प्रदर्शन पर पर्याप्त लाभ की भी रिपोर्ट करते हैं। अधिक आक्रामक कमी के लिए, पेपर पज़लकेवी को परिमाणीकरण के साथ जोड़ता है और मूल भंडारण के 18.7% का उपयोग करके 93% से अधिक पूर्ण केवी प्रदर्शन की रिपोर्ट करता है। स्रोत आपूर्ति किए गए पाठ में मॉडल नाम, व्यक्तिगत बेंचमार्क स्कोर, रनटाइम माप या हार्डवेयर कॉन्फ़िगरेशन प्रदान नहीं करता है।

कुल मिलाकर, विवरण में कैश प्रतिनिधित्व, पृष्ठ-वार अपघटन, ध्यान गणना और रिपोर्ट किए गए भंडारण बिंदु शामिल हैं। यह आपूर्ति किए गए खाते की सीमाओं की भी पहचान करता है: स्रोत बेंचमार्क नाम और समग्र प्रदर्शन तुलना देता है, जबकि मॉडल नाम, विस्तृत स्कोर, रनटाइम माप और हार्डवेयर कॉन्फ़िगरेशन अनिर्दिष्ट रहते हैं।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

केवी-कैश मेमोरी लंबे-संदर्भ अनुमान को सीमित कर सकती है। यदि रिपोर्ट किए गए परिणाम पेपर के मूल्यांकन से परे हैं, तो पृष्ठ-वार संपीड़न मेमोरी आवश्यकताओं को कम कर सकता है और निश्चित भंडारण बजट के तहत लंबे संदर्भ को अधिक व्यावहारिक बना सकता है।

व्यावहारिक मुद्दा संदर्भ की लंबाई और स्मृति के बीच एक समझौता है। एक बड़ा केवी कैश पहले के टोकन से अधिक जानकारी को संरक्षित करता है, लेकिन यह अनुमान के दौरान भंडारण आवश्यकताओं को भी बढ़ाता है। इसलिए उस कैश को संपीड़ित करने से यह प्रभावित हो सकता है कि एक सिस्टम एक निश्चित मेमोरी बजट के भीतर कितने संदर्भ को संभाल सकता है। पज़लकेवी एक नए प्रशिक्षित मॉडल की आवश्यकता के बजाय कैश के पूर्ण भागों के प्रतिनिधित्व को कम करके सीधे उस बाधा को लक्षित करता है।

पेपर के रिपोर्ट किए गए परिणाम संभावित रूप से उपयोगी हैं क्योंकि वे दो अलग-अलग भंडारण बिंदुओं पर प्रदर्शन का वर्णन करते हैं। पहला पेपर के 96% से अधिक पूर्ण केवी संदर्भ प्रदर्शन को मूल भंडारण के लगभग 60% पर बरकरार रखता है। दूसरा प्रस्तावित अपघटन को परिमाणीकरण के साथ जोड़ता है और मूल भंडारण के 18.7% पर 93% से अधिक की रिपोर्ट करता है। यदि ये परिणाम सामान्यीकृत होते हैं, तो दृष्टिकोण ऑपरेटरों को लंबे-संदर्भ मॉडल की सेवा करते समय आउटपुट गुणवत्ता के मुकाबले मेमोरी खपत को संतुलित करने का एक और तरीका दे सकता है।

पृष्ठ-वार डिज़ाइन स्रोत में वर्णित पूर्व दृष्टिकोणों से पेपर का मुख्य तकनीकी अंतर भी है। वे दृष्टिकोण मॉडल भार, अंशांकन सक्रियण या व्यापक कैश क्षेत्र पर साझा आधार से प्राप्त निश्चित प्रक्षेपण स्थानों का उपयोग करते हैं। इसके बजाय पज़लकेवी मानता है कि छोटे कैश क्षेत्रों में उपयोगी स्थानीय संरचना हो सकती है और उन्हें स्वतंत्र रूप से संपीड़ित किया जा सकता है। यह प्रतिनिधित्व को स्थानीय भिन्नता के प्रति अधिक प्रतिक्रियाशील बना सकता है, लेकिन आपूर्ति किया गया स्रोत केवल लेखकों के प्रयोगों की रिपोर्ट करता है। यह स्थापित नहीं करता है कि विधि सभी मॉडल आर्किटेक्चर और वर्कलोड में व्यापक रूप से बेहतर, उत्पादन-तैयार या फायदेमंद है।

परिणाम की व्याख्या के लिए वह अंतर मायने रखता है। रिपोर्ट किए गए प्रतिशत बताए गए भंडारण बजट के तहत पूर्ण केवी के साथ पेपर की तुलना का वर्णन करते हैं; वे, आपूर्ति किए गए स्रोत में, परिनियोजन के बारे में प्रत्येक प्रश्न का उत्तर नहीं देते हैं या प्रत्येक मॉडल और कार्यभार के लिए कोई परिणाम स्थापित नहीं करते हैं। इसलिए संभावित मूल्य इस बात से जुड़ा है कि रिपोर्ट की गई स्मृति और प्रदर्शन संबंध व्यवहार में उपयोगी रहता है या नहीं।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

पेपर एक संस्करण-एक arXiv प्रीप्रिंट है, और स्रोत मूल्यांकन किए गए मॉडल, हार्डवेयर, विलंबता प्रभाव, कार्यान्वयन उपलब्धता, या स्वतंत्र प्रतिकृति की पहचान नहीं करता है। वे विवरण यह निर्धारित करेंगे कि रिपोर्ट किए गए भंडारण लाभ व्यावहारिक सेवा लाभों में परिवर्तित होते हैं या नहीं।

सबसे महत्वपूर्ण अगला प्रश्न यह है कि क्या रिपोर्ट किया गया प्रदर्शन पेपर की बताई गई सेटिंग्स के बाहर मूल्यांकन में टिक पाता है। स्रोत का नाम RULER और LongBench है और कहता है कि प्रयोग दो मॉडल, एकाधिक संदर्भ लंबाई और बेंचमार्क सेटिंग्स को कवर करते हैं, लेकिन यह मॉडल की पहचान नहीं करता है या प्रति-कार्य परिणाम नहीं दिखाता है। पाठकों को यह जानने के लिए उन विवरणों की आवश्यकता होगी कि मॉडल आर्किटेक्चर, ध्यान लेआउट, अनुक्रम लंबाई और कार्य प्रकार के प्रति विधि कितनी संवेदनशील है।

भंडारण में कमी कम सेवा लागत या तेज़ अनुमान के समान नहीं है। आपूर्ति किया गया पाठ विलंबता, थ्रूपुट, मेमोरी बैंडविड्थ, ऊर्जा उपयोग, डीकंप्रेसन ओवरहेड या हार्डवेयर जिस पर प्रयोग चला, की रिपोर्ट नहीं करता है। क्योंकि पज़लकेवी सघन और तथ्यात्मक दोनों पृष्ठों पर ध्यान की गणना करता है और पृष्ठों को क्रमिक रूप से संपीड़ित करता है, कार्यान्वयन विवरण प्रभावित कर सकता है कि मेमोरी बचत शुद्ध परिचालन लाभ उत्पन्न करती है या नहीं। तैनाती अर्थशास्त्र के बारे में दावों में पेपर के भंडारण दावों का अनुवाद करने से पहले वे माप आवश्यक हैं।

मात्राबद्ध परिणाम भी अलग जांच की गारंटी देता है। जब परिमाणीकरण जोड़ा जाता है तो पेपर मूल भंडारण के 18.7% पर 93% से अधिक पूर्ण केवी प्रदर्शन की रिपोर्ट करता है, लेकिन स्रोत परिमाणीकरण योजना, परिशुद्धता, त्रुटि वितरण या परिणाम कार्यों पर समान रूप से लागू होता है या नहीं, यह निर्दिष्ट नहीं करता है। प्रीप्रिंट को संस्करण एक के रूप में पहचाना गया है और आपूर्ति किए गए स्रोत में इसे स्वतंत्र रूप से मान्य नहीं किया गया है। कोड रिलीज़, अन्य कैश-संपीड़न विधियों के साथ व्यापक तुलना और अतिरिक्त मॉडलों पर प्रतिकृति विधि की व्यावहारिक पहुंच और सीमाओं को स्पष्ट करेगी।

आगे के साक्ष्य पेपर के समग्र परिणामों को वास्तविक उपयोग से जोड़ देंगे। विशेष रूप से, गायब मॉडल पहचान, प्रति-कार्य परिणाम, सिस्टम माप, परिमाणीकरण विवरण, कोड और स्वतंत्र प्रतिकृति यह खुला छोड़ देते हैं कि सेवा के लिए महत्वपूर्ण सेटिंग्स में विधि कितनी लगातार व्यवहार करती है। कार्य विकसित होने पर वे चूकें पालन की जाने वाली मुख्य बातें हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याChatGPT और एलएलएमएआई प्रशिक्षणट्रांसफार्मरआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?