भाषा एआई गाइड

बहु-प्रश्न ध्यान

मल्टी-क्वेरी अटेंशन (एमक्यूए) ट्रांसफॉर्मर अटेंशन पर एक मेमोरी-सेविंग ट्विस्ट है जो सभी अटेंशन हेड्स में कुंजियों और मूल्यों के एक सेट को साझा करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

गहरा गोता

मानक मल्टी-हेड ध्यान प्रत्येक हेड को उसकी अपनी क्वेरी, कुंजी और मूल्य अनुमान देता है। पीढ़ी के दौरान, सभी पिछले टोकन की कुंजी और मान को प्रत्येक चरण में कैश और पुनः लोड किया जाना चाहिए - यह केवी कैश मुख्य बाधा बन जाता है, क्योंकि इसे मेमोरी से पढ़ना गणित की तुलना में धीमा है। 2019 में नोम शाज़ीर द्वारा प्रस्तावित मल्टी-क्वेरी अटेंशन, प्रति व्यक्ति अलग-अलग क्वेरी अनुमान रखता है लेकिन कुंजी और मानों को एक ही साझा हेड में संक्षिप्त कर देता है। यह केवी कैश को हेड्स की संख्या के बराबर कारक तक कम कर देता है, कभी-कभी 8x से 64x तक छोटा। परिणाम बहुत तेज़ ऑटोरेग्रेसिव डिकोडिंग और हल्का मेमोरी फ़ुटप्रिंट है, केवल मामूली गुणवत्ता में गिरावट के साथ। एक मध्य मार्ग, समूहीकृत-क्वेरी ध्यान, व्यापार-बंद को संतुलित करता है।

तकनीकी अंतर्दृष्टि

एमक्यूए में, क्वेरी वेट अभी भी एच अलग क्वेरी वैक्टर का उत्पादन करते हैं, लेकिन एक एकल कुंजी प्रक्षेपण और एकल मूल्य प्रक्षेपण सभी प्रमुखों में साझा किए जाते हैं। प्रत्येक प्रमुख समान कुंजियों और मानों के विरुद्ध अपनी स्वयं की क्वेरी का उपयोग करके ध्यान की गणना करता है। क्योंकि कैश्ड K और V टेंसर अब हेड्स की संख्या के साथ स्केल नहीं करते हैं, डिकोडिंग के दौरान मेमोरी बैंडविड्थ तेजी से गिरती है - और बैंडविड्थ, गणना नहीं, आधुनिक त्वरक पर पीढ़ी की गति को गेट करती है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

मल्टी-क्वेरी अटेंशन का भविष्य

एमक्यूए ने स्थापित किया कि आप अनावश्यक कुंजी/मूल्य प्रमुखों को थोड़े से नुकसान के साथ काट सकते हैं, और वह अंतर्दृष्टि अब लगभग हर तेज़-अनुमान एलएलएम को आकार देती है। यह क्षेत्र बड़े पैमाने पर ग्रुप-क्वेरी अटेंशन (जीक्यूए) पर केंद्रित हो गया है, जिसका उपयोग लामा 2/3 और कई अन्य में किया जाता है, जो अधिकांश स्पीडअप को बनाए रखते हुए गुणवत्ता को पुनर्प्राप्त करने के लिए एक के बजाय कुछ केवी समूहों का उपयोग करता है। भविष्य का काम लंबे संदर्भों और सस्ती सेवा प्रदान करने के लिए इन विचारों को केवी-कैश संपीड़न, परिमाणीकरण और बहु-अव्यक्त ध्यान के साथ मिश्रित करता है।

वास्तविक विश्व कार्यान्वयन

चैट सहायकों में टोकन-दर-टोकन पीढ़ी को तेज़ करना जहां केवी कैश, कच्ची गणना नहीं, थ्रूपुट को सीमित करता है।

Google का PaLM, जिसने कुशल बड़े पैमाने पर अनुमान को सक्षम करने के लिए मल्टी-क्वेरी अटेंशन का उपयोग किया।

प्रति-अनुरोध केवी कैश मेमोरी को सिकोड़कर एक जीपीयू पर कई समवर्ती उपयोगकर्ताओं को सेवा प्रदान करना।

लामा 2 70बी और लामा 3 में समूहीकृत-क्वेरी ध्यान, पूर्ण-ध्यान गुणवत्ता के साथ एमक्यूए की गति को संतुलित करने वाला एक प्रत्यक्ष वंशज।

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

समूहीकृत-प्रश्न ध्यान

अक्सर पूछे जाने वाले प्रश्नों

What is Multi-Query Attention?

मल्टी-क्वेरी अटेंशन (एमक्यूए) ट्रांसफॉर्मर अटेंशन पर एक मेमोरी-सेविंग ट्विस्ट है जो सभी अटेंशन हेड्स में कुंजियों और मूल्यों के एक सेट को साझा करता है। यह मेमोरी को सिकोड़कर नाटकीय रूप से टेक्स्ट जेनरेशन को गति देता है, जिसे मॉडल को इधर-उधर करना पड़ता है।

मल्टी-क्वेरी अटेंशन सभी ध्यान प्रमुखों में क्या साझा करता है?

एमक्यूए प्रति व्यक्ति अलग-अलग प्रश्न रखता है लेकिन सभी प्रमुखों में एक प्रमुख प्रक्षेपण और एक मूल्य प्रक्षेपण साझा करता है।

प्राथमिक बाधा क्या है जिसे एमक्यूए ऑटोरेग्रेसिव पीढ़ी के दौरान संबोधित करता है?

प्रत्येक चरण में बड़े केवी कैश को पुनः लोड करना बैंडविड्थ-बाध्य है; डिकोडिंग को तेज करने के लिए एमक्यूए उस कैश को छोटा कर देता है।

मोटे तौर पर एमक्यूए केवी कैश को किस कारक से छोटा करता है?

चूँकि कुंजियाँ और मान H शीर्ष से एक पर सिमट जाते हैं, कैश लगभग शीर्ष गिनती तक सिकुड़ जाता है।

एमक्यूए का उपयोग करने का मुख्य समझौता क्या है?

कुंजियाँ और मान साझा करने से प्रतिनिधित्व क्षमता थोड़ी कम हो जाती है, जिससे बड़े गति लाभ के बदले थोड़ी गुणवत्ता में कमी आती है।

मानक मल्टी-हेड अटेंशन और एमक्यूए के बीच कौन सा संस्करण बैठता है?

ग्रुपेड-क्वेरी अटेंशन (जीक्यूए) गुणवत्ता और गति को संतुलित करते हुए एक के बजाय कई केवी समूहों का उपयोग करता है।