पृष्ठांकित ध्यान और वीएलएलएम
PagedAttention एक मेमोरी-प्रबंधन तकनीक है जो एक भाषा मॉडल के ध्यान कैश को एक बड़े सन्निहित खंड के बजाय छोटे पुन: प्रयोज्य ब्लॉकों में संग्रहीत करती है।
सिंहावलोकन
It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.
गहरा गोता
जब कोई भाषा मॉडल टेक्स्ट उत्पन्न करता है, तो वह देखे गए प्रत्येक टोकन के लिए एक 'केवी कैश' (कुंजी और मूल्य वैक्टर) रखता है ताकि अगला टोकन पूर्ण संदर्भ में भाग ले सके। परंपरागत रूप से प्रत्येक अनुरोध अपनी अधिकतम संभव लंबाई के लिए जीपीयू मेमोरी आकार के एक बड़े सन्निहित स्लैब को आरक्षित करता है, जब अनुक्रम छोटे होते हैं या लंबाई में भिन्न होते हैं तो बड़ी मात्रा में बर्बाद होते हैं। यूसी बर्कले के 2023 वीएलएलएम पेपर में पेश किया गया पेजेडअटेंशन, ऑपरेटिंग सिस्टम से वर्चुअल मेमोरी पेजिंग के विचार को उधार लेता है: यह केवी कैश को निश्चित आकार के ब्लॉक में विभाजित करता है जो मेमोरी में कहीं भी रह सकता है और मांग पर आवंटित किया जा सकता है। एक लुकअप तालिका तार्किक टोकन स्थितियों को भौतिक ब्लॉकों में मैप करती है। यह स्मृति विखंडन को लगभग समाप्त कर देता है और ब्लॉकों को साझा करने देता है, उदाहरण के लिए एक ही प्रॉम्प्ट से कई आउटपुट में।
तकनीकी अंतर्दृष्टि
केवी कैश को निश्चित आकार के पृष्ठों में विभाजित किया गया है, प्रत्येक में टोकन की एक निर्धारित संख्या के लिए कुंजी और मान होते हैं। एक प्रति-अनुक्रम ब्लॉक तालिका भौतिक पृष्ठ स्थानों पर तार्किक स्थिति को मैप करती है, इसलिए अनुक्रम के कैश को सन्निहित होने की आवश्यकता नहीं है। चूँकि समान उपसर्ग (एक साझा सिस्टम प्रॉम्प्ट, या बीम-सर्च शाखाएँ) कॉपी-ऑन-राइट के माध्यम से समान भौतिक पृष्ठों को इंगित कर सकते हैं, मेमोरी को डुप्लिकेट के बजाय पुन: उपयोग किया जाता है, जिससे अपशिष्ट 60% से कुछ प्रतिशत तक कम हो जाता है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
पेजेडअटेंशन और वीएलएलएम का भविष्य
वीएलएलएम एक डिफ़ॉल्ट ओपन-सोर्स अनुमान बैकबोन बन गया है, और PagedAttention के विचार अब अधिकांश सर्विंग स्टैक में दिखाई देते हैं। गहन उपसर्ग कैशिंग (सभी उपयोगकर्ताओं के बीच कैश्ड सिस्टम संकेतों का पुन: उपयोग), अलग-अलग मशीनों पर अलग-अलग प्रीफ़िल और डिकोड, बेहतर निष्कासन नीतियां, और परिमाणीकरण और सट्टा डिकोडिंग के साथ सख्त एकीकरण की अपेक्षा करें। जैसे-जैसे संदर्भ विंडो लाखों टोकन में बढ़ती है, किफायती सेवा प्रदान करने के लिए कुशल पृष्ठांकित केवी प्रबंधन और भी अधिक केंद्रीय हो जाता है।
वास्तविक विश्व कार्यान्वयन
एक ओपन-सोर्स एलएलएम एपीआई होस्ट करना जहां वीएलएलएम उच्च थ्रूपुट पर एक जीपीयू से कई समवर्ती चैट उपयोगकर्ताओं को सेवा प्रदान करता है
उपसर्ग कैशिंग के माध्यम से हजारों अनुरोधों में एक लंबा सिस्टम प्रॉम्प्ट साझा करना ताकि इसे एक बार संसाधित किया जाए, बार-बार नहीं
रनिंग बीम सर्च या एकाधिक नमूना पूर्णताएं जो कॉपी-ऑन-राइट के माध्यम से सामान्य प्रॉम्प्ट के लिए केवी ब्लॉक साझा करती हैं
जीपीयू मेमोरी अपशिष्ट को विखंडन से काटना ताकि प्रदाता एक ही हार्डवेयर पर एक साथ अधिक सत्र पैक कर सके
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PagedAttention and vLLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
विभेदक गोपनीयता
अक्सर पूछे जाने वाले प्रश्नों
What is PagedAttention and vLLM?
PagedAttention एक मेमोरी-प्रबंधन तकनीक है जो एक भाषा मॉडल के ध्यान कैश को एक बड़े सन्निहित खंड के बजाय छोटे पुन: प्रयोज्य ब्लॉकों में संग्रहीत करती है। यह वीएलएलएम को शक्ति प्रदान करता है, एक ओपन-सोर्स सर्विंग इंजन जो नाटकीय रूप से बढ़ाता है कि एक एकल जीपीयू कितने अनुरोधों को संभाल सकता है।
टेक्स्ट जेनरेशन के दौरान 'केवी कैश' क्या संग्रहित करता है?
केवी कैश प्रत्येक पूर्व टोकन के लिए कुंजी और मान वैक्टर रखता है, जिससे मॉडल को प्रत्येक चरण की पुन: गणना किए बिना पूर्ण संदर्भ में शामिल होने की सुविधा मिलती है।
किस ऑपरेटिंग-सिस्टम अवधारणा ने पेजेडअटेंशन को प्रेरित किया?
PagedAttention वर्चुअल मेमोरी पेजिंग को उधार लेता है: KV कैश को निश्चित आकार के पेजों में विभाजित किया जाता है जो ब्लॉक टेबल द्वारा मैप किए गए कहीं भी रह सकते हैं।
PagedAttention पारंपरिक KV कैश आवंटन की किस समस्या का समाधान करता है?
प्रति अनुरोध एक बड़ा सन्निहित स्लैब, अधिकतम लंबाई के आकार का, आरक्षित करने से बड़ी मात्रा में जीपीयू मेमोरी बर्बाद हो गई। पेजिंग कचरे को कम करते हुए, मांग पर छोटे ब्लॉक आवंटित करता है।
PagedAttention एक सामान्य प्रॉम्प्ट के लिए एकाधिक आउटपुट को मेमोरी कैसे साझा करने देता है?
समान उपसर्ग (साझा संकेत या बीम-खोज शाखाएं) समान भौतिक केवी पृष्ठों को संदर्भित करते हैं, केवल तभी प्रतिलिपि बनाते हैं जब कोई शाखा अलग हो जाती है।
वीएलएलएम और पेजेडअटेंशन मूल रूप से कहाँ विकसित किया गया था?
वीएलएलएम और पेजेडअटेंशन एल्गोरिदम 2023 के पेपर में यूसी बर्कले से निकले और जल्द ही व्यापक रूप से इस्तेमाल किया जाने वाला ओपन-सोर्स सर्विंग इंजन बन गए।