तकनीकी गाइड

सट्टा डिकोडिंग

सट्टा डिकोडिंग बड़े भाषा मॉडल को एक छोटे, तेज़ 'ड्राफ्ट' मॉडल का उपयोग करके आगे के कई टोकन का अनुमान लगाने के लिए तेजी से पाठ उत्पन्न करने में सक्षम बनाती है, फिर बड़े मॉडल से उन सभी को एक साथ सत्यापित किया जाता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It speeds up inference 2-3x with identical output quality.

गहरा गोता

आम तौर पर एक एलएलएम एक समय में एक टोकन पर पाठ उत्पन्न करता है: प्रत्येक टोकन को विशाल मॉडल के माध्यम से एक पूर्ण फॉरवर्ड पास की आवश्यकता होती है, और जब तक वर्तमान समाप्त नहीं हो जाता तब तक आप अगला शुरू नहीं कर सकते। यह धीमा है क्योंकि यह मेमोरी-बाउंड है, कंप्यूट-बाउंड नहीं है - GPU अपना अधिकांश समय वजन लोड करने में बिताता है, गणित करने में नहीं। सट्टा डिकोडिंग बाधा को तोड़ती है। एक छोटा, सस्ता ड्राफ्ट मॉडल, मान लीजिए, पांच उम्मीदवार टोकन का एक हिस्सा प्रस्तावित करता है। बड़ा 'लक्ष्य' मॉडल तब सभी पांचों को एक समानांतर फॉरवर्ड पास में संसाधित करता है और उनकी जांच करता है। जो टोकन उसके उत्पादन से मेल खाते हैं उन्हें स्वीकार किया जाता है; पहली असहमति पर यह सुधार करता है और बाकी को खारिज कर देता है। क्योंकि कई टोकन को सत्यापित करने की लागत एक को बनाने के समान ही होती है, स्वीकृत अनुमान लगभग निःशुल्क होते हैं।

तकनीकी अंतर्दृष्टि

चतुर हिस्सा एक अस्वीकृति-नमूना नियम है जो गारंटी देता है कि आउटपुट वितरण गणितीय रूप से अकेले लक्ष्य मॉडल को चलाने के समान है - इसलिए गुणवत्ता अनुमानित नहीं है, यह सटीक है। स्वीकृति दर गति बढ़ाती है: जितना बेहतर छोटा मॉडल बड़े मॉडल की भविष्यवाणी करता है, प्रति सत्यापन चरण में उतने ही अधिक टोकन चिपकते हैं। मेडुसा जैसे वेरिएंट लक्ष्य मॉडल में अतिरिक्त भविष्यवाणी प्रमुख जोड़ते हैं, और ईएजीएलई फीचर स्पेस में ड्राफ्ट करते हैं, जिससे एक अलग ड्राफ्ट मॉडल की आवश्यकता समाप्त हो जाती है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

सट्टा डिकोडिंग का भविष्य

वीएलएलएम और टेन्सोरआरटी-एलएलएम जैसे सर्विंग स्टैक में सट्टा डिकोडिंग डिफ़ॉल्ट होती जा रही है। स्व-प्रारूपण विधियों (मेडुसा, ईगल, लुकहेड) के हावी होने की अपेक्षा करें क्योंकि वे दूसरे मॉडल को बनाए रखने से बचते हैं, साथ ही पेड़-आधारित अटकलें जो प्रति चरण कई उम्मीदवार शाखाओं का सत्यापन करती हैं। जैसे-जैसे मॉडल बढ़ते हैं, मेमोरी-बाउंड बाधा बिगड़ती जाती है, जिससे अटकलें और भी अधिक मूल्यवान हो जाती हैं, और हार्डवेयर-जागरूक ड्राफ्टर्स वास्तविक दुनिया के स्पीडअप को और अधिक बढ़ा देंगे।

वास्तविक विश्व कार्यान्वयन

उत्पादन सहायक में प्रतिक्रिया विलंबता को कम करने के लिए 70बी चैट मॉडल के लिए टोकन का प्रस्ताव करने वाला 7बी ड्राफ्ट मॉडल

मेडुसा हेड्स एलएलएम पर आधारित है, इसलिए यह एक अलग ड्राफ्ट मॉडल के बिना एक साथ कई भविष्य के टोकन की भविष्यवाणी करता है

वीएलएलएम एक सर्विंग क्लस्टर पर टोकन-प्रति-सेकंड थ्रूपुट बढ़ाने के लिए सट्टा डिकोडिंग को सक्षम करता है

स्वीकृति दर और समग्र गति को बढ़ावा देने के लिए मॉडल के छिपे हुए फीचर वाले स्थान में ईएजीएलई प्रारूपण

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

ईगल के साथ सट्टा डिकोडिंग

अक्सर पूछे जाने वाले प्रश्नों

What is Speculative Decoding?

सट्टा डिकोडिंग बड़े भाषा मॉडल को एक छोटे, तेज़ 'ड्राफ्ट' मॉडल का उपयोग करके आगे के कई टोकन का अनुमान लगाने के लिए तेजी से पाठ उत्पन्न करने में सक्षम बनाती है, फिर बड़े मॉडल से उन सभी को एक साथ सत्यापित किया जाता है। यह समान आउटपुट गुणवत्ता के साथ अनुमान को 2-3 गुना तेज कर देता है।

सट्टा डिकोडिंग का मूल विचार क्या है?

एक तेज़ ड्राफ्ट मॉडल कई टोकन का प्रस्ताव करता है, और बड़ा लक्ष्य मॉडल उन सभी को एक ही समानांतर पास में जांचता है।

सामान्य एक-टोकन-ए-टाइम एलएलएम पीढ़ी धीमी क्यों है?

प्रत्येक चरण मुख्य रूप से भारी गणना करने के बजाय मेमोरी से भारी वजन वाले मैट्रिक्स को लोड करता है, इसलिए GPU का कम उपयोग होता है।

पहले टोकन पर क्या होता है जहां ड्राफ्ट और लक्ष्य मॉडल असहमत होते हैं?

असहमति तक के टोकन स्वीकार किए जाते हैं; बेमेल होने के बाद से उन्हें अस्वीकार कर दिया जाता है और लक्ष्य मॉडल का सही टोकन रखा जाता है।

सट्टा डिकोडिंग आउटपुट गुणवत्ता को कैसे प्रभावित करती है?

अस्वीकृति-नमूना नियम यह गारंटी देता है कि अंतिम वितरण लक्ष्य मॉडल से बिल्कुल मेल खाता है, इसलिए गुणवत्ता अपरिवर्तित है।

सट्टा डिकोडिंग से स्पीडअप को सबसे सीधे तौर पर क्या निर्धारित करता है?

लक्ष्य मॉडल प्रति सत्यापन चरण में जितने अधिक प्रारूपित टोकन स्वीकार करेगा, गति उतनी ही अधिक होगी।