भाषा एआई गाइड

गहराई का मिश्रण

गहराई का मिश्रण (एमओडी) एक ट्रांसफार्मर को अलग-अलग टोकन पर अलग-अलग मात्रा में गणना खर्च करने देता है, प्रत्येक परत की भारी गणना के माध्यम से केवल 'महत्वपूर्ण' टोकन को रूट करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

गहरा गोता

मानक ट्रांसफार्मर प्रत्येक परत को प्रत्येक टोकन पर लागू करते हैं, यहां तक ​​कि विराम चिह्न जैसे तुच्छ भी। Google DeepMind द्वारा 2024 में पेश किया गया गहराई का मिश्रण, प्रत्येक ब्लॉक पर एक छोटा राउटर जोड़ता है जो पूर्ण आत्म-ध्यान और एमएलपी गणना से गुजरने के लिए टोकन के एक निश्चित शीर्ष-के अंश का चयन करता है; बाकी लोग अवशिष्ट कनेक्शन के माध्यम से ब्लॉक को छोड़ देते हैं। क्योंकि प्रति परत केवल k टोकन संसाधित होते हैं, कुल गणना (FLOPs) को सीमित किया जाता है और पहले से ही जाना जाता है, पहले की गतिशील-गहराई विधियों के विपरीत जो अप्रत्याशित रूप से भिन्न होती थीं। यह बैचिंग और हार्डवेयर उपयोग को कुशल बनाता है। MoD-प्रशिक्षित मॉडल प्रति फॉरवर्ड पास में कम FLOPs का उपयोग करके बेसलाइन ट्रांसफार्मर की गुणवत्ता से मेल खा सकते हैं, या एक ही गणना में उच्च गुणवत्ता तक पहुंच सकते हैं, और यह विचार 'MoDE' मॉडल देने के लिए स्वाभाविक रूप से मिक्सचर-ऑफ-एक्सपर्ट्स के साथ मिलकर तैयार होता है जो गहराई और चौड़ाई दोनों पर रूट करता है।

तकनीकी अंतर्दृष्टि

प्रत्येक MoD ब्लॉक पर, एक सीखा हुआ लीनियर राउटर प्रत्येक टोकन को स्कोर करता है और स्कोर के आधार पर टॉप-के रखता है; चयनित टोकन ध्यान और एमएलपी से गुजरते हैं, जबकि अचयनित टोकन को अवशिष्ट पथ द्वारा अपरिवर्तित आगे बढ़ाया जाता है। एक निश्चित टॉप-के (प्रति-टोकन सीमा के बजाय) का उपयोग करने से गणना ग्राफ़ स्थिर और टेंसर आकार स्थिर हो जाता है, जो हार्डवेयर-अनुकूल है। राउटर को बाकी नेटवर्क के साथ प्रशिक्षित किया जाता है, और कारण पीढ़ी सहायक भविष्यवक्ताओं का उपयोग करती है ताकि रूटिंग निर्णय भविष्य के टोकन पर नज़र न डालें।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

गहराई के मिश्रण का भविष्य

मॉडल स्केल के रूप में सशर्त गणना दक्षता के लिए एक प्रमुख लीवर है, और MoD एक प्रारंभिक, स्वच्छ उदाहरण है। मिक्सचर-ऑफ-एक्सपर्ट्स (गहराई और विशेषज्ञों दोनों पर रूटिंग) के साथ गहन एकीकरण की अपेक्षा करें, अनुकूली बजट जो आसान इनपुट के लिए सिकुड़ते हैं, और सीखे हुए राउटर जो बेहतर पहचान करते हैं कि कौन से टोकन को वास्तव में गहरी प्रसंस्करण की आवश्यकता है। चूंकि अनुमानित लागत परिनियोजन अर्थशास्त्र पर हावी है, ऐसी तकनीकें जो मॉडलों को केवल आवश्यकतानुसार 'कठिन सोचने' देती हैं, पूर्वानुमानित विलंबता को बनाए रखते हुए, बड़े पैमाने के आर्किटेक्चर में मानक बनने की संभावना है।

वास्तविक विश्व कार्यान्वयन

फिलर टोकन पर गहरी गणना को छोड़कर लंबे दस्तावेजों को संसाधित करने के लिए आवश्यक एफएलओपी को कम करना

एक ऐसे मॉडल का प्रशिक्षण जो कम गणना पर आधारभूत गुणवत्ता से मेल खाता हो, जिससे सेवा लागत कम हो

परत की गहराई और विशेषज्ञ की पसंद दोनों पर रूट करने के लिए मिक्सचर-ऑफ-एक्सपर्ट्स (MoDE) के साथ संयोजन

प्रति टोकन अनुमानित, निश्चित विलंबता रखते हुए क्योंकि प्रति-परत गणना बजट पहले से तय होता है

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

एजेंटों का मिश्रण एकत्रीकरण

अक्सर पूछे जाने वाले प्रश्नों

What is Mixture of Depths?

गहराई का मिश्रण (एमओडी) एक ट्रांसफार्मर को अलग-अलग टोकन पर अलग-अलग मात्रा में गणना खर्च करने देता है, प्रत्येक परत की भारी गणना के माध्यम से केवल 'महत्वपूर्ण' टोकन को रूट करता है। यह एक निश्चित, पूर्वानुमानित गणना बजट रखते हुए आसान टोकन को संसाधित करने की लागत में कटौती करता है।

विभिन्न टोकन में गहराई का मिश्रण क्या भिन्न होता है?

MoD प्रत्येक परत की भारी गणना के माध्यम से केवल कुछ टोकन को रूट करता है, इसलिए अलग-अलग टोकन प्रभावी रूप से अलग-अलग गहराई प्राप्त करते हैं।

रक्षा मंत्रालय अपने गणना बजट को पूर्वानुमानित कैसे रखता है?

प्रति ब्लॉक टोकन का एक निश्चित टॉप-के चुनना एफएलओपी को कैप करता है और टेंसर आकार को स्थिर रखता है, जो हार्डवेयर के अनुकूल है।

उन टोकन का क्या होता है जिन्हें राउटर किसी दिए गए ब्लॉक पर नहीं चुनता है?

अचयनित टोकन ब्लॉक की गणना को बायपास करते हैं और अवशिष्ट पथ द्वारा अपरिवर्तित आगे बढ़ाए जाते हैं।

गहराई का मिश्रण किसने प्रस्तुत किया?

गहराई का मिश्रण Google DeepMind द्वारा डायनेमिक ट्रांसफार्मर कंप्यूट पर 2024 के पेपर में पेश किया गया था।

MoD को विशेषज्ञों के मिश्रण के साथ मिलाने से क्या परिणाम मिलता है?

विशेषज्ञ रूटिंग के साथ गहराई रूटिंग के संयोजन से 'MoDE' मॉडल प्राप्त होते हैं जो परतों और विशेषज्ञों दोनों पर गणना करते हैं।