विचार का कंकाल समानांतर डिकोडिंग
स्केलेटन-ऑफ-थॉट (एसओटी) एक संकेतन और डिकोडिंग तकनीक है जो पहले एक भाषा मॉडल से उत्तर बिंदुओं के एक संक्षिप्त ढांचे को रेखांकित करने के लिए कहती है, फिर प्रत्येक बिंदु को समानांतर में विस्तारित करती है।
सिंहावलोकन
यह मायने रखता है क्योंकि यह मॉडल को फिर से प्रशिक्षित किए बिना लंबे उत्तरों की दीवार-घड़ी की विलंबता को लगभग 2x तक कम कर सकता है।
गहरा गोता
बड़े भाषा मॉडल आम तौर पर एक समय में एक टोकन उत्पन्न करते हैं, इसलिए एक लंबा उत्तर धीमा होता है क्योंकि प्रत्येक शब्द अपने से पहले वाले का इंतजार करता है। 2023 में सिंघुआ और Microsoft के शोधकर्ताओं द्वारा पेश किया गया स्केलेटन-ऑफ-थॉट, काम का पुनर्गठन करता है। पहली कॉल मॉडल से एक संक्षिप्त कंकाल मांगती है: 3 से 10 बिंदु शीर्षकों की एक क्रमांकित सूची, प्रत्येक में बस कुछ शब्द। फिर कॉलों का दूसरा बैच प्रत्येक बिंदु को स्वतंत्र रूप से और एक साथ विस्तारित करता है, क्योंकि बिंदु एक दूसरे पर निर्भर नहीं होते हैं। अंतिम उत्तर में विस्तारों को वापस एक साथ जोड़ दिया जाता है। क्योंकि धीमा विस्तार चरण समानांतर में चलता है, उन प्रश्नों के लिए कुल विलंबता तेजी से गिरती है जिनके उत्तर स्वाभाविक रूप से स्वतंत्र भागों में विघटित होते हैं, जैसे युक्तियों को सूचीबद्ध करना या विकल्पों की तुलना करना।
तकनीकी अंतर्दृष्टि
SoT यह फायदा उठाता है कि डिकोडर अनुमान विलंबता-बाध्य है, हमेशा गणना-बाध्य नहीं: एक एकल अनुरोध अक्सर GPU को कम उपयोग में छोड़ देता है। एक बैच के रूप में बिंदु विस्तार चलाने से हार्डवेयर व्यस्त रहता है और प्रति-बिंदु पीढ़ी ओवरलैप हो जाती है। एपीआई मॉडल के साथ, विस्तार समवर्ती अनुरोधों के रूप में जारी किए जाते हैं; स्थानीय मॉडलों के साथ, वे एक बैच फॉरवर्ड पास साझा करते हैं। स्केलेटन चरण एक निश्चित शॉर्ट ओवरहेड जोड़ता है, इसलिए नेट स्पीडअप उत्तर की लंबाई और स्वतंत्र बिंदुओं की संख्या के साथ बढ़ता है।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
कंकाल-ऑफ़-थॉट पैरेलल डिकोडिंग का भविष्य
एसओटी विचारों को अनुकूली रूटिंग में विलय करने की अपेक्षा करें: जब कोई क्वेरी स्पष्ट रूप से विघटित हो जाती है तो सिस्टम पता लगाएगा और समानांतर विस्तार पर स्विच करेगा, गणित प्रमाण जैसे कसकर निर्भर कार्यों के लिए अनुक्रमिक तर्क पर वापस आ जाएगा। गतिशील ग्राफ़ निर्भरता वाले एसओटी जैसे वेरिएंट उन बिंदुओं की अनुमति देते हैं जो एक दूसरे को संदर्भित करते हैं। जैसे-जैसे सेवारत ढाँचे देशी बैच उप-अनुरोध समर्थन और सट्टा डिकोडिंग जोड़ते हैं, समानांतर-विघटन रणनीतियाँ मैन्युअल प्रॉम्प्ट ट्रिक के बजाय एक मानक विलंबता-कमी परत बन जाएंगी।
वास्तविक विश्व कार्यान्वयन
एक चैटबॉट को तेज़ करना जो सभी आठ युक्तियों को एक साथ विस्तारित करके 'मुझे क्लाउड लागत कम करने के लिए 8 युक्तियाँ दें' का उत्तर देता है।
एक ग्राहक-सहायता सहायक कम प्रतिक्रिया विलंबता के साथ एक संरचित बहु-खंड समस्या निवारण मार्गदर्शिका तैयार करता है।
एक तुलनात्मक उत्तर तैयार करना (दो उत्पादों के पक्ष और विपक्ष) जहां प्रत्येक गोली समवर्ती रूप से भरी जाती है।
लॉन्ग-फॉर्म जेनरेशन के दौरान GPU उपयोग को बढ़ाने के लिए बैकएंड सर्विंग सिस्टम स्वतंत्र उत्तर अनुभागों को बैच कर रहा है।
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Skeleton-of-Thought Parallel Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
मास्कजीआईटी समानांतर टोकन डिकोडिंग
अक्सर पूछे जाने वाले प्रश्नों
स्केलेटन-ऑफ-थॉट पैरेलल डिकोडिंग क्या है?
स्केलेटन-ऑफ-थॉट (एसओटी) एक संकेतन और डिकोडिंग तकनीक है जो पहले एक भाषा मॉडल से उत्तर बिंदुओं के एक संक्षिप्त ढांचे को रेखांकित करने के लिए कहती है, फिर प्रत्येक बिंदु को समानांतर में विस्तारित करती है। यह मायने रखता है क्योंकि यह मॉडल को दोबारा प्रशिक्षित किए बिना लंबे उत्तरों की वॉल-क्लॉक विलंबता को लगभग 2x तक कम कर सकता है।
स्केलेटन-ऑफ़-थॉट का पहला चरण क्या उत्पन्न करता है?
SoT पहले मॉडल को बिंदु शीर्षकों का एक संक्षिप्त कंकाल उत्सर्जित करने के लिए प्रेरित करता है, जिसे बाद में अलग से विस्तारित किया जाता है।
बिंदु-विस्तार चरण समानांतर में क्यों चल सकता है?
कंकाल बिंदुओं को स्वतंत्र होने के लिए डिज़ाइन किया गया है, इसलिए उन्हें विस्तारित करने के लिए भाई-बहनों की प्रतीक्षा करने की आवश्यकता नहीं है।
सामान्य एलएलएम डिकोडिंग में मुख्य बाधा एसओटी लक्ष्य क्या है?
मानक डिकोडिंग विलंब-बद्ध है क्योंकि प्रत्येक टोकन पिछले वाले की प्रतीक्षा करता है; एसओटी ओवरलैप्स दीवार-घड़ी के समय को कम करने का काम करते हैं।
किस प्रकार के प्रश्न के लिए SoT सबसे अधिक स्पीडअप देता है?
जो उत्तर कई स्वतंत्र भागों में विघटित होते हैं, वे सबसे अधिक लाभान्वित होते हैं, क्योंकि प्रत्येक भाग समवर्ती रूप से विस्तारित होता है।
एकल अनुक्रमिक पीढ़ी की तुलना में SoT कितना ओवरहेड जोड़ता है?
कंकाल चरण एक छोटी सी निश्चित विलंबता जोड़ता है, जो लंबे उत्तरों पर समानांतर विस्तार से अधिक होता है।