भाषा एआई गाइड

केवी कैश

केवी कैश कुंजी और मान वैक्टर को संग्रहीत करता है जो एक ट्रांसफार्मर पहले से ही पिछले टोकन के लिए गणना कर चुका है, इसलिए इसे उत्पन्न होने वाले प्रत्येक नए शब्द के लिए उन्हें पुन: गणना करने की आवश्यकता नहीं है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.

गहरा गोता

ट्रांसफॉर्मर एक समय में एक टोकन पर टेक्स्ट उत्पन्न करते हैं, और प्रत्येक नए टोकन की ध्यान परत की तुलना प्रत्येक पिछले टोकन से करने की आवश्यकता होती है। ध्यान तंत्र प्रत्येक टोकन को क्वेरी, कुंजी और मान वेक्टर में बदल देता है। कैशिंग के बिना, टोकन नंबर 1,000 उत्पन्न करने का मतलब हर चरण पर सभी 999 पुराने टोकन के लिए कुंजियों और मूल्यों की पुन: गणना करना होगा - द्विघात, बेकार काम। केवी कैश उन कुंजी और मान वैक्टरों को पहली बार गणना करने के बाद सहेजता है और उनका पुन: उपयोग करता है, इसलिए प्रत्येक नया चरण केवल एकल नवीनतम टोकन के लिए वैक्टर की गणना करता है और संग्रहीत कैश पर ध्यान देता है। यह प्रति-टोकन लागत को अनुक्रम लंबाई के साथ स्केलिंग से घटाकर लगभग स्थिर कर देता है। ट्रेड-ऑफ मेमोरी है: कैश संदर्भ की लंबाई, परतों की संख्या और ध्यान प्रमुखों के साथ रैखिक रूप से बढ़ता है, जो अक्सर लंबे-संदर्भ सेवा में प्रमुख मेमोरी उपभोक्ता बन जाता है।

तकनीकी अंतर्दृष्टि

'प्रीफ़िल' चरण के दौरान मॉडल पूरे प्रॉम्प्ट को संसाधित करता है और कैश भरता है; 'डीकोड' के दौरान यह प्रति चरण एक टोकन के/वी को जोड़ता है और पुनः जोड़ता है। कैश का आकार चयनित परिशुद्धता में 2 (K और V) × लेयर्स × हेड्स × हेड_डिम × सीक्वेंस_लेंथ × बैच के रूप में मापता है। इसे नियंत्रित करने के लिए, आधुनिक मॉडल सभी प्रमुखों में कुंजी/मूल्यों को साझा करने के लिए समूहीकृत-क्वेरी या बहु-क्वेरी ध्यान का उपयोग करते हैं, और वीएलएलएम जैसी सेवा प्रणालियाँ गैर-सन्निहित ब्लॉकों में कैश आवंटित करने, विखंडन और अपशिष्ट को काटने के लिए पेजेडअटेंशन का उपयोग करती हैं।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

केवी कैश का भविष्य

जैसे-जैसे संदर्भ विंडो सैकड़ों-हजारों टोकन में फैलती है, केवी कैश केंद्रीय बाधा बन जाता है, इसलिए नवाचार भयंकर होता है: 8 या 4 बिट्स तक कैश मात्रा का ठहराव, निष्कासन नीतियां जो कम-महत्व वाले टोकन को छोड़ देती हैं, क्रॉस-अनुरोध उपसर्ग साझाकरण, और सीपीयू या डिस्क पर ऑफलोडिंग। मल्टी-हेड अव्यक्त ध्यान जैसे वास्तुशिल्प बदलाव कैश को ही संपीड़ित करते हैं। बहुत लंबे संदर्भों को सस्ते में और उच्च थ्रूपुट पर परोसने के उद्देश्य से ध्यान वेरिएंट और मेमोरी सिस्टम के निरंतर सह-डिज़ाइन की अपेक्षा करें।

वास्तविक विश्व कार्यान्वयन

प्रत्येक बार बातचीत के इतिहास को पुन: संसाधित करने के बजाय उससे कैश्ड कुंजियों/मानों का पुन: उपयोग करके चैटबॉट उत्तरों को तेज़ करना।

प्रीफ़िक्स कैशिंग जो कई उपयोगकर्ताओं के बीच लंबे सिस्टम प्रॉम्प्ट के लिए कैश साझा करती है, लागत और विलंबता में कटौती करती है।

वीएलएलएम का पेजेडअटेंशन एक जीपीयू पर कई समवर्ती अनुरोधों को कुशलतापूर्वक पूरा करने के लिए ब्लॉक में केवी कैश का प्रबंधन करता है।

सीमित जीपीयू मेमोरी में लंबे संदर्भों को फिट करने के लिए केवी कैश को कम सटीकता के साथ परिमाणित करना।

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is KV Cache?

केवी कैश कुंजी और मान वैक्टर को संग्रहीत करता है जो एक ट्रांसफार्मर पहले से ही पिछले टोकन के लिए गणना कर चुका है, इसलिए इसे उत्पन्न होने वाले प्रत्येक नए शब्द के लिए उन्हें पुन: गणना करने की आवश्यकता नहीं है। यह टेक्स्ट जनरेशन के तेज़ होने का सबसे बड़ा कारण है - और मुख्य बात यह है कि लंबी बातचीत के दौरान आपकी GPU मेमोरी ख़त्म हो जाती है।

KV कैश क्या संग्रहित करता है?

केवी कैश पहले के टोकन से कुंजी और मूल्य वैक्टर रखता है ताकि ध्यान पुन: गणना करने के बजाय उनका पुन: उपयोग कर सके।

केवी कैश मुख्य रूप से किस समस्या का समाधान करता है?

कैशिंग के बिना, प्रत्येक नए टोकन को प्रत्येक पिछले टोकन के लिए K/V की पुनः गणना करने की आवश्यकता होगी, जो कि बेकार है; कैश प्रति-टोकन लागत को लगभग स्थिर बना देता है।

KV कैश का मुख्य नकारात्मक पहलू क्या है?

कैश अनुक्रम लंबाई, परतों और शीर्षों के साथ बढ़ता है, जो अक्सर लंबे-संदर्भ सेवा में जीपीयू मेमोरी का प्रमुख उपभोक्ता बन जाता है।

कौन सी तकनीक ध्यान प्रमुखों में कुंजी और मान साझा करके केवी कैश आकार को कम करती है?

समूहीकृत-क्वेरी और बहु-क्वेरी ध्यान कई क्वेरी प्रमुखों को कम कुंजी/मूल्य सेट साझा करने देते हैं, जिससे कैश काफी हद तक सिकुड़ जाता है।

केवी कैश के सापेक्ष ट्रांसफार्मर अनुमान के दो चरण क्या हैं?

प्रीफ़िल कैश को प्रॉम्प्ट के K/V से भरता है; डिकोड प्रत्येक चरण में एक नए टोकन के/वी को जोड़ता है और कैश पर पुनः निर्भर करता है।