केवी कैश अनुकूलन
केवी कैश उन कुंजियों और मानों को संग्रहीत करता है जिनकी गणना ट्रांसफार्मर ने पहले ही कर ली है, इसलिए यह हर नए टोकन के लिए दोबारा काम नहीं करता है - लेकिन यह गीगाबाइट तक बढ़ सकता है।
सिंहावलोकन
KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.
गहरा गोता
एक ट्रांसफार्मर में, प्रत्येक नया टोकन ध्यान की कुंजी (K) और मान (V) के माध्यम से सभी पिछले टोकन पर ध्यान केंद्रित करता है। हर चरण पर पूरे अनुक्रम के लिए K और V की पुनः गणना करना द्विघात और बेकार होगा, इसलिए मॉडल उन्हें कैश करते हैं: KV कैश। नकारात्मक पक्ष आकार है. अनुक्रम लंबाई, बैच आकार, परतों और शीर्षों के साथ कैश रैखिक रूप से बढ़ता है, इसलिए एक लंबे-संदर्भ अनुरोध मॉडल वजन की तुलना में अधिक जीपीयू मेमोरी का उपभोग कर सकता है। अनुकूलन कई कोणों से इससे निपटता है: पृष्ठांकित मेमोरी (vLLM का PagedAttention) विखंडन को खत्म करने और साझाकरण को सक्षम करने के लिए कैश को गैर-सन्निहित ब्लॉकों में संग्रहीत करता है; परिमाणीकरण K और V को 8-बिट या 4-बिट में संग्रहीत करता है; और ग्रुपेड-क्वेरी अटेंशन (जीक्यूए) और मल्टी-क्वेरी अटेंशन (एमक्यूए) जैसे वास्तुशिल्प परिवर्तन कई क्वेरी हेड्स को कम कुंजी/वैल्यू हेड्स साझा करने देते हैं, जिससे स्रोत पर कैश आकार कम हो जाता है।
तकनीकी अंतर्दृष्टि
PagedAttention ऑपरेटिंग सिस्टम से वर्चुअल-मेमोरी पेजिंग उधार लेता है: कैश एक लुकअप टेबल के माध्यम से मैप किए गए निश्चित आकार के ब्लॉक में रहता है, इसलिए अनुरोध केवल उन ब्लॉक का उपयोग करते हैं जिनकी उन्हें आवश्यकता होती है और समान उपसर्ग (एक साझा सिस्टम प्रॉम्प्ट की तरह) समान ब्लॉक को इंगित कर सकते हैं। डीपसीक मॉडल में उपयोग किया जाने वाला मल्टी-हेड लेटेंट अटेंशन (एमएलए), के और वी को एक छोटे साझा लेटेंट वेक्टर में संपीड़ित करता है, सटीकता बनाए रखते हुए मेमोरी को नाटकीय रूप से काटता है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
केवी कैश अनुकूलन का भविष्य
जैसे-जैसे संदर्भ विंडो सैकड़ों हजारों या लाखों टोकन तक फैलती है, केवी कैश सेवा की प्रमुख लागत बन जाती है। आक्रामक कैश संपीड़न और निष्कासन (कम ध्यान वाले टोकन को छोड़ना), डिफ़ॉल्ट के रूप में क्रॉस-रिक्वेस्ट उपसर्ग साझाकरण, सीपीयू या एनवीएमई पर कोल्ड कैश को ऑफलोड करना और एमएलए और जीक्यूए जैसे आर्किटेक्चर मानक बनने की अपेक्षा करें। कैश प्रबंधन तेजी से स्तरों और स्मार्ट प्रीफ़ेचिंग के साथ पूर्ण मेमोरी पदानुक्रम जैसा होगा।
वास्तविक विश्व कार्यान्वयन
वीएलएलएम का पेजेडअटेंशन स्मृति विखंडन के बिना केवी ब्लॉकों को पैक करके कई समवर्ती चैट सत्रों की सेवा प्रदान करता है
लामा मॉडल में समूहीकृत-क्वेरी ध्यान केवी कैश आकार को कम करता है ताकि लंबे संदर्भ जीपीयू मेमोरी में फिट हो सकें
लंबे दस्तावेज़ सारांश के दौरान कैश मेमोरी को लगभग आधा करने के लिए KV कैश को 8-बिट (KV8) तक परिमाणित करना
उपसर्ग कैशिंग जो हजारों एपीआई अनुरोधों में साझा सिस्टम प्रॉम्प्ट के केवी ब्लॉक का पुन: उपयोग करता है
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
केवी कैश
अक्सर पूछे जाने वाले प्रश्नों
What is KV Cache Optimization?
केवी कैश उन कुंजियों और मानों को संग्रहीत करता है जिनकी गणना ट्रांसफार्मर ने पहले ही कर ली है, इसलिए यह हर नए टोकन के लिए दोबारा काम नहीं करता है - लेकिन यह गीगाबाइट तक बढ़ सकता है। केवी कैश अनुकूलन उस मेमोरी को सिकोड़ता है और प्रबंधित करता है ताकि मॉडल एक साथ अधिक उपयोगकर्ताओं को लंबे संदर्भ प्रदान कर सकें।
KV कैश क्या संग्रहीत करता है और क्यों?
पूर्व टोकन से कुंजियाँ और मान कैशिंग करने से हर नए टोकन पर ध्यान की गणना दोबारा करने से बचा जा सकता है, जिससे समय की बचत होती है।
केवी कैश मेमोरी समस्या क्यों बन सकता है?
संदर्भ की लंबाई और समवर्तीता के साथ कैश आकार का पैमाना होता है, इसलिए लंबे अनुरोध भारी मात्रा में जीपीयू मेमोरी का उपयोग कर सकते हैं।
पेजेडअटेंशन किस ऑपरेटिंग-सिस्टम अवधारणा को उधार लेता है?
PagedAttention कैश को OS पेजिंग की तरह, एक तालिका के माध्यम से मैप किए गए गैर-सन्निहित निश्चित आकार के ब्लॉक में संग्रहीत करता है।
ग्रुप्ड-क्वेरी और मल्टी-क्वेरी अटेंशन केवी कैश आकार को कैसे कम करते हैं?
एकाधिक क्वेरी शीर्षों में कुंजी/मूल्य शीर्षों को साझा करने का अर्थ है संग्रहीत करने के लिए बहुत कम K और V वैक्टर।
KV कैश में उपसर्ग साझाकरण का एक लाभ क्या है?
एक साझा सिस्टम प्रॉम्प्ट समान KV प्रविष्टियाँ उत्पन्न करता है, इसलिए एकाधिक अनुरोध उन्हें डुप्लिकेट करने के बजाय समान ब्लॉकों को इंगित कर सकते हैं।