अलग-अलग प्रीफ़िल और डिकोड सर्विंग
एक सर्विंग आर्किटेक्चर जो बड़े भाषा मॉडल अनुमान को दो अलग-अलग चरणों में विभाजित करता है - प्रीफ़िल और डीकोड - और उन्हें जीपीयू के विभिन्न पूलों पर चलाता है।
सिंहावलोकन
It matters because these two phases have opposite hardware appetites, and forcing them onto the same machines wastes capacity and hurts latency.
गहरा गोता
जब एलएलएम उत्तर देता है, तो यह दो चरणों में काम करता है। प्रीफ़िल संपूर्ण प्रॉम्प्ट को एक ही बार में पढ़ता है और कुंजी-मूल्य (KV) कैश बनाता है; यह एक बड़ा, समानांतर, कंप्यूट-बाउंड बर्स्ट है जो GPU की गणित इकाइयों को संतृप्त करता है। डिकोड फिर एक समय में एक टोकन उत्पन्न करता है, प्रत्येक चरण पूरे केवी कैश को पढ़ता है - एक मेमोरी-बैंडविड्थ-बाउंड, हल्के से गणना करने वाला ट्रिकल। एक साथ चलाएं, एक लंबी प्रीफ़िल हर किसी के डिकोड (हेड-ऑफ़-लाइन ब्लॉकिंग) को रोक देती है, और दोनों को बैचने से हस्तक्षेप पैदा होता है। पृथक्करण एक जीपीयू पूल पर प्रीफ़िल डालता है और दूसरे पर डीकोड करता है, उनके बीच केवी कैश को एनवीलिंक या इनफिनीबैंड जैसे तेज़ इंटरकनेक्ट पर स्थानांतरित करता है। प्रत्येक पूल को स्वतंत्र रूप से ट्यून और स्केल किया जाता है, जिससे गुडपुट में सुधार होता है, टेल लेटेंसी को सुचारू किया जाता है, और ऑपरेटरों को समय-से-पहले-टोकन और समय-प्रति-आउटपुट-टोकन लक्ष्यों को एक साथ हिट करने की सुविधा मिलती है।
तकनीकी अंतर्दृष्टि
दोनों चरण अपनी अड़चन में भिन्न हैं। प्रीफ़िल सभी प्रॉम्प्ट टोकन को समानांतर में संसाधित करता है, इसलिए इसके FLOPs प्रॉम्प्ट लंबाई के साथ स्केल होते हैं और यह टेंसर कोर को अधिकतम करता है। डिकोड ऑटोरेग्रेसिव है: प्रत्येक नए टोकन को एक फॉरवर्ड पास की आवश्यकता होती है जो एचबीएम से पूर्ण केवी कैश को फिर से पढ़ता है, इसलिए थ्रूपुट को मेमोरी बैंडविड्थ द्वारा गेट किया जाता है, गणना नहीं। पृथक्करण आकार, बैचिंग और यहां तक कि प्रत्येक पूल के लिए अलग-अलग समानता का चयन करके इसका फायदा उठाता है, फिर केवी कैश को प्रीफ़िल श्रमिकों से डिकोड श्रमिकों तक भेजता है।
सामरिक प्रभाव
लागत और बजट
वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।
स्पष्ट निर्णय
तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।
गुणवत्ता नियंत्रण
बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।
अलग-अलग प्रीफ़िल और डिकोड सर्विंग का भविष्य
उम्मीद करें कि उत्पादन स्टैक में पृथक्करण एक डिफ़ॉल्ट बन जाएगा। डिस्टसर्व, स्प्लिटवाइज और मूनकेक जैसे सिस्टम ने इसे लोकप्रिय बनाया, और वीएलएलएम और एनवीआईडीआईए डायनमो अब अलग-अलग मोड शिप करते हैं। अनुसंधान केवी-कैश ट्रांसफर अनुकूलन, कैश पूलिंग और अनुरोधों में पुन: उपयोग, शिफ्टिंग ट्रैफिक के तहत प्रीफिल/डीकोड अनुपात के गतिशील पुन: संतुलन, और प्रीफ़िक्स कैशिंग और चंक्ड प्रीफ़िल के साथ सख्त एकीकरण पर जोर दे रहा है। जैसे-जैसे संदर्भ विंडो लाखों टोकन में बढ़ती है, इन चरणों को अलग करना लागत प्रभावी, कम-विलंबता सेवा के लिए तेजी से आवश्यक हो जाता है।
वास्तविक विश्व कार्यान्वयन
एक चैट सहायक लंबे दस्तावेज़ को एक कंप्यूट-हेवी प्रीफ़िल क्लस्टर में रूट करता है, फिर टाइपिंग विलंबता को सुचारू रखने के लिए मेमोरी-अनुकूलित डिकोड क्लस्टर से उत्तरों को स्ट्रीम करता है।
एनवीआईडीआईए डायनेमो और वीएलएलएम ऑपरेटरों को अलग-अलग प्रीफ़िल और डिकोड कार्यकर्ता समूहों को तैनात करने देते हैं ताकि लंबे संकेतों का विस्फोट चल रही पीढ़ियों को रोक न सके।
मूनकेक (मूनशॉट एआई के किमी द्वारा प्रयुक्त) प्रीफिल और डीकोड को अलग करता है और पैमाने पर अनावश्यक त्वरित पुनर्गणना में कटौती करने के लिए एक वितरित केवी-कैश पूल जोड़ता है।
एक कोड-समापन सेवा छोटे संकेतों के लिए एक छोटा प्रीफ़िल पूल और एक बड़ा डिकोड पूल समर्पित करती है, क्योंकि अधिकांश लागत कई आउटपुट टोकन को स्ट्रीम करने से आती है।
जोखिम और रेलिंग
एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।
बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।
जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।
कार्यान्वयन रोडमैप
कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।
यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।
त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।
स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Disaggregated Prefill and Decode Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
कुबेरनेट्स पर केसर्व और मॉडल सर्विंग
अक्सर पूछे जाने वाले प्रश्नों
What is Disaggregated Prefill and Decode Serving?
एक सर्विंग आर्किटेक्चर जो बड़े भाषा मॉडल अनुमान को दो अलग-अलग चरणों में विभाजित करता है - प्रीफ़िल और डीकोड - और उन्हें जीपीयू के विभिन्न पूलों पर चलाता है। यह मायने रखता है क्योंकि इन दो चरणों में विपरीत हार्डवेयर भूख होती है, और उन्हें एक ही मशीन पर मजबूर करने से क्षमता बर्बाद होती है और विलंबता को नुकसान पहुंचता है।
विभिन्न जीपीयू पूलों पर प्रीफिल और डीकोड को अलग करने का मुख्य हार्डवेयर कारण क्या है?
प्रीफ़िल पूरे प्रॉम्प्ट को समानांतर में संसाधित करता है और गणना को संतृप्त करता है, जबकि डीकोड प्रत्येक चरण में केवी कैश को पढ़ता है और मेमोरी बैंडविड्थ द्वारा सीमित होता है - विपरीत भूख जो अलग, स्वतंत्र रूप से ट्यून किए गए पूल को उचित ठहराती है।
प्रीफिल वर्कर्स से डिकोड वर्कर्स में कौन सी डेटा संरचना स्थानांतरित की जानी चाहिए?
प्रीफ़िल प्रॉम्प्ट के लिए KV कैश बनाता है; डिकोड को जनरेट करना जारी रखने के लिए उस कैश की आवश्यकता होती है, इसलिए कैश को डिकोड पूल में तेज़ इंटरकनेक्ट पर भेज दिया जाता है।
साझा-जीपीयू सेटअप में पृथक्करण विशेष रूप से कौन सी समस्या को कम करता है?
साझा जीपीयू पर एक लंबा प्रीफ़िल बर्स्ट चल रहे डिकोड चरणों को अवरुद्ध कर सकता है; उन्हें अलग करने से हस्तक्षेप रुक जाता है और टेल विलंबता स्थिर हो जाती है।
प्रीफ़िल को आक्रामक तरीके से क्यों बैच किया जा सकता है लेकिन अलग-अलग ट्यूनिंग से डिकोड का लाभ मिलता है?
प्रीफ़िल सभी प्रॉम्प्ट टोकन को एक साथ प्रोसेस करता है, इसलिए बड़े बैच टेंसर कोर को अच्छी तरह से फीड करते हैं; डिकोड एक समय में एक टोकन उत्पन्न करता है और मेमोरी द्वारा गेट किया जाता है, इसलिए इसका पैमाना अलग-अलग होता है।
अलग-अलग पूलों के बीच केवी कैश को स्थानांतरित करने के लिए आमतौर पर कौन से इंटरकनेक्ट का उपयोग किया जाता है?
उच्च-बैंडविड्थ, कम-विलंबता लिंक जैसे एनवीलिंक (इंट्रा-नोड) और इनफिनीबैंड (इंटर-नोड) की आवश्यकता है ताकि केवी-कैश ट्रांसफर नई बाधा न बने।