तकनीकी गाइड

विशेषज्ञों का मिश्रण

विशेषज्ञों का मिश्रण (एमओई) एक मॉडल डिज़ाइन है जो एक नेटवर्क को कई विशिष्ट उप-नेटवर्क में विभाजित करता है और प्रति इनपुट केवल कुछ को सक्रिय करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

गहरा गोता

एक मानक ट्रांसफार्मर प्रत्येक इनपुट को समान सघन परतों के माध्यम से चलाता है, इसलिए मॉडल को अधिक स्मार्ट बनाने का मतलब आमतौर पर प्रत्येक गणना को अधिक महंगा बनाना है। विशेषज्ञों का मिश्रण उस कड़ी को तोड़ता है। यह बड़ी फ़ीड-फ़ॉरवर्ड परत को कई छोटे 'विशेषज्ञ' नेटवर्क और एक छोटे 'राउटर' से बदल देता है जो यह तय करता है कि कौन से विशेषज्ञ प्रत्येक टोकन को संभालते हैं। आम तौर पर केवल शीर्ष 1 या 2 विशेषज्ञ ही काम करते हैं, इसलिए एक मॉडल में सैकड़ों अरबों कुल पैरामीटर हो सकते हैं लेकिन प्रति टोकन केवल एक छोटा सा अंश ही सक्रिय होता है। यही कारण है कि मिक्सट्रल 8x7B जैसे मॉडल और GPT-4 के पीछे की अफवाह वाली वास्तुकला आनुपातिक रूप से उच्च अनुमान लागत के बिना उच्च गुणवत्ता तक पहुंचती है। व्यापार-बंद जटिलता है: सभी विशेषज्ञों को अभी भी स्मृति में फिट होना चाहिए, और राउटर कुछ विशेषज्ञों को गलत मार्ग या अधिभारित कर सकता है, इसलिए प्रशिक्षण के लिए सावधानीपूर्वक संतुलन की आवश्यकता होती है।

तकनीकी अंतर्दृष्टि

MoE का हृदय गेटिंग नेटवर्क है, एक छोटी सीखी हुई परत जो आने वाले टोकन के लिए प्रत्येक विशेषज्ञ को स्कोर करती है और टोकन को शीर्ष-k उच्चतम स्कोरर (अक्सर k = 1 या 2) तक पहुंचाती है। राउटर को कुछ पसंदीदा विशेषज्ञों को सब कुछ भेजने से रोकने के लिए, प्रशिक्षण एक सहायक 'लोड-बैलेंसिंग लॉस' जोड़ता है जो असमान उपयोग को दंडित करता है। चूँकि केवल k विशेषज्ञ ही प्रति टोकन चलाते हैं, गणना (FLOPs) लगभग स्थिर रहती है, भले ही आप अधिक विशेषज्ञ जोड़ते हों, इसलिए कुल पैरामीटर और प्रति-टोकन लागत पैमाने स्वतंत्र रूप से होते हैं।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

विशेषज्ञों के मिश्रण का भविष्य

MoE फ्रंटियर-स्केल मॉडल के लिए एक डिफ़ॉल्ट उपकरण बनता जा रहा है क्योंकि यह क्षमता को लागत से अलग करता है। सीमित हार्डवेयर पर विशाल विरल मॉडल पेश करने के लिए बेहतर विशेषज्ञों, अधिक संदर्भ पर विचार करने वाली स्मार्ट रूटिंग और बेहतर तकनीकों की अपेक्षा करें। अनुसंधान स्मृति समस्या से भी निपट रहा है, क्योंकि सभी विशेषज्ञों को विशेषज्ञ ऑफलोडिंग और परिमाणीकरण के माध्यम से लोड किया जाना चाहिए, भले ही कुछ रन हों। जैसे-जैसे मिक्सट्रल और डीपसीक-एमओई जैसे खुले मॉडल परिपक्व होंगे, विरल आर्किटेक्चर संभवतः छोटे जीपीयू बजट पर अधिक कुशल सहायकों को शक्ति प्रदान करेंगे।

वास्तविक विश्व कार्यान्वयन

मिक्सट्रल 8x7B 8 विशेषज्ञों का उपयोग करता है और प्रति टोकन 2 को सक्रिय करता है, जो लगभग 47B कुल पैरामीटर देता है लेकिन तेज़, सस्ते अनुमान के लिए प्रति टोकन केवल ~13B सक्रिय होता है।

डीपसीक और क्वेन बड़े MoE भाषा मॉडल शिप करते हैं जो कम प्रति-टोकन गणना के साथ चलते समय बेंचमार्क पर सघन मॉडल से मेल खाते हैं।

क्लाउड एलएलएम प्रदाता MoE का उपयोग करते हैं इसलिए एक विशाल मॉडल कई उपयोगकर्ताओं को किफायती रूप से सेवा प्रदान कर सकता है, क्योंकि प्रत्येक अनुरोध केवल कुछ विशेषज्ञों को ही प्रभावित करता है।

Google के पहले के स्विच ट्रांसफार्मर को प्रशिक्षण गणना को प्रबंधनीय बनाए रखने के लिए टॉप-1 रूटिंग का उपयोग करके एक ट्रिलियन से अधिक मापदंडों तक बढ़ाया गया था।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

लोरा विशेषज्ञों का मिश्रण

अक्सर पूछे जाने वाले प्रश्नों

What is Mixture of Experts?

विशेषज्ञों का मिश्रण (एमओई) एक मॉडल डिज़ाइन है जो एक नेटवर्क को कई विशिष्ट उप-नेटवर्क में विभाजित करता है और प्रति इनपुट केवल कुछ को सक्रिय करता है। यह प्रत्येक भविष्यवाणी को तेज़ और सस्ता रखते हुए मॉडलों को विशाल ज्ञान रखने की सुविधा देता है।

विशेषज्ञों के मिश्रण की परत में, यह क्या तय करता है कि कौन से विशेषज्ञ किसी दिए गए टोकन को संसाधित करते हैं?

एक छोटा गेटिंग नेटवर्क टोकन के लिए प्रत्येक विशेषज्ञ को स्कोर करना सीखता है और इसे शीर्ष स्कोरिंग वाले लोगों तक पहुंचाता है। रूटिंग सीखी जाती है, निश्चित या यादृच्छिक नहीं।

प्रति टोकन लागत में समान वृद्धि के बिना एक MoE मॉडल में सघन मॉडल की तुलना में कहीं अधिक कुल पैरामीटर क्यों हो सकते हैं?

क्योंकि केवल शीर्ष-के विशेषज्ञ ही प्रति टोकन फायर करते हैं, अधिक विशेषज्ञों को जोड़ने से कुल पैरामीटर गिनती बढ़ने पर भी सक्रिय गणना लगभग स्थिर रहती है।

MoE प्रशिक्षण के दौरान लोड-बैलेंसिंग (सहायक) हानि किस समस्या का समाधान करती है?

संतुलन के बिना, राउटर मुट्ठी भर विशेषज्ञों का पक्ष लेता है। सहायक हानि असमान उपयोग को दंडित करती है इसलिए सभी विशेषज्ञ प्रशिक्षित हो जाते हैं।

मिक्सट्रल 8x7B प्रति टोकन अपने 8 विशेषज्ञों में से 2 को सक्रिय करता है। इसका इसकी गणना बनाम इसके आकार के बारे में क्या मतलब है?

8 में से केवल 2 विशेषज्ञ सक्रिय होने के कारण, प्रति टोकन सक्रिय पैरामीटर (~13बी) कुल ~47बी से बहुत छोटे हैं, जिससे अनुमान लागत कम हो जाती है।

समान रूप से सक्षम सघन मॉडल की तुलना में MoE मॉडल का वास्तविक नकारात्मक पहलू क्या है?

भले ही केवल कुछ विशेषज्ञ प्रति टोकन की गणना करते हैं, प्रत्येक विशेषज्ञ के वजन को मेमोरी में लोड किया जाना चाहिए, जिससे MoE मॉडल सेवा के लिए मेमोरी-भूखे हो जाएं।