የቋንቋ AI መመሪያ

የብዝሃ-ጥያቄ ትኩረት

የብዝሃ-ጥያቄ ትኩረት (MQA) በሁሉም የትኩረት ራሶች ላይ አንድ የቁልፍ እና የእሴቶችን ስብስብ የሚያጋራ የማስታወሻ ቆጣቢ የትራንስፎርመር ትኩረት ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

ጥልቅ ዳይቭ

መደበኛ የብዝሃ-ጭንቅላት ትኩረት ለእያንዳንዱ ጭንቅላት የራሱን ጥያቄ፣ ቁልፍ እና የእሴት ትንበያ ይሰጣል። በትውልድ ጊዜ የሁሉም ያለፉ ቶከኖች ቁልፎች እና እሴቶች በእያንዳንዱ እርምጃ መሸጎጫ እና እንደገና መጫን አለባቸው - ይህ የ KV መሸጎጫ ዋናው ማነቆ ይሆናል ፣ ምክንያቱም ከማስታወስ ማንበብ ከሂሳብ ራሱ ያነሰ ነው። በ2019 በNoam Shazeer የቀረበው የብዝሃ-ጥያቄ ትኩረት በአንድ ጭንቅላት የተለየ የመጠይቅ ትንበያ ያስቀምጣል ነገር ግን ቁልፎችን እና እሴቶቹን ወደ አንድ የጋራ ጭንቅላት ይሰብራል። ይህ የKV መሸጎጫውን ከጭንቅላት ብዛት ጋር እኩል በሆነ ምክንያት ይቀንሳል፣ አንዳንዴ ከ8x እስከ 64x ያነሰ። ውጤቱ በጣም ፈጣን አውቶማቲክ ዲኮዲንግ እና ቀላል የማህደረ ትውስታ አሻራ ነው፣ መጠነኛ ጥራት ያለው ማጥለቅ ብቻ ነው። መሃከለኛ መሬት፣ የቡድን-መጠይቅ ትኩረት፣ የንግድ ልውውጡን ሚዛኑን የጠበቀ ነው።

ቴክኒካዊ ግንዛቤ

በMQA ውስጥ፣ የመጠይቅ ክብደቶች አሁንም H የተለየ የመጠይቅ ቬክተር ያፈራሉ፣ ነገር ግን አንድ ቁልፍ ትንበያ እና ነጠላ እሴት ትንበያ በሁሉም ጭንቅላት ላይ ይጋራሉ። እያንዳንዱ ጭንቅላት የራሱን መጠይቅ ከተመሳሳይ ቁልፎች እና እሴቶች ጋር በመጠቀም ትኩረትን ያሰላል። የተሸጎጡ የK እና V ቴነሮች ከጭንቅላት ብዛት ጋር ስለማይመዘኑ፣በመግለጫ ጊዜ የማህደረ ትውስታ ባንድዊድዝ በከፍተኛ ሁኔታ ይወድቃል -እና የመተላለፊያ ይዘት ሳይሆን የመተላለፊያ ፍጥነት በዘመናዊ አፋጣኞች ላይ ነው።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።

መድረስ እና መድረስ

በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።

ግልጽ ውሳኔዎች

አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።

የብዝሃ-ጥያቄ ትኩረት የወደፊት

MQA ተደጋጋሚ ቁልፍ/ዋጋ ጭንቅላቶችን በትንሽ ጉዳት መቁረጥ እንደምትችል አረጋግጧል፣ እና ያ ግንዛቤ አሁን እያንዳንዱን ፈጣን ግምት LLM ይቀርፃል። ሜዳው በሊማ 2/3 እና ሌሎች ብዙ ጥቅም ላይ የዋለው በቡድን-ጥያቄ ትኩረት (GQA) ላይ በአብዛኛው ተሰብስቧል፣ ይህም አብዛኛውን የፍጥነት ፍጥነት ጠብቆ ጥራቱን ለማስመለስ ከአንድ ይልቅ ጥቂት የKV ቡድኖችን ይጠቀማል። የወደፊት ስራ እነዚህን ሃሳቦች ከKV-cache መጭመቂያ፣መጠኑ እና ከብዙ ስውር ትኩረት ጋር በማዋሃድ ረጅም አውዶችን እና ርካሽ አገልግሎትን ለመግፋት።

የእውነተኛ-ዓለም አተገባበር

በቻት ረዳቶች ውስጥ የማስመሰያ-ቶከን ትውልድን ማፋጠን፣ የ KV መሸጎጫ፣ ጥሬ ስሌት ሳይሆን፣ የውጤት መጠንን ይገድባል።

_AIU_PROTECTED_11__'s PaLM፣ የብዙ መጠይቅ ትኩረትን ተጠቅሞ ቀልጣፋ መጠነ ሰፊ መረጃን ለማንቃት።

የ KV መሸጎጫ ማህደረ ትውስታን በመቀነስ ብዙ ተጠቃሚዎችን በአንድ ጂፒዩ ማገልገል።

የተመደበ-ጥያቄ ትኩረት በላማ 2 70ቢ እና ላማ 3፣ የMQAን ፍጥነት ከሙሉ ትኩረት ጥራት ጋር በማመጣጠን ቀጥተኛ ዘር።

አደጋዎች እና የጥበቃ መንገዶች

የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።

ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።

የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።

የትግበራ ፍኖተ ካርታ

1

ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።

2

ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።

3

ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።

4

የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

የቡድን-የጥያቄ ትኩረት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Multi-Query Attention?

የብዝሃ-ጥያቄ ትኩረት (MQA) በሁሉም የትኩረት ራሶች ላይ አንድ የቁልፍ እና የእሴቶችን ስብስብ የሚያጋራ የማስታወሻ ቆጣቢ የትራንስፎርመር ትኩረት ነው። ሞዴሉ መወዛወዝ ያለበትን ማህደረ ትውስታን በመቀነስ የጽሑፍ ማመንጨትን በአስደናቂ ሁኔታ ያፋጥናል።

የብዝሃ-ጥያቄ ትኩረት በሁሉም የትኩረት ራሶች ላይ ምን ያካፍላል?

MQA በእያንዳንዱ ጭንቅላት የተለያዩ መጠይቆችን ይይዛል ነገር ግን አንድ ቁልፍ ትንበያ እና አንድ እሴት ትንበያ በሁሉም ጭንቅላት ላይ ያካፍላል።

በራስ ተነሳሽነት ማመንጨት ወቅት MQA የሚመለከተው ዋና ማነቆ ምንድነው?

ትልቁን የ KV መሸጎጫ እንደገና መጫን እያንዳንዱ እርምጃ ከመተላለፊያ ይዘት ጋር የተያያዘ ነው; መፍታትን ለማፋጠን MQA ያንን መሸጎጫ ይቀንሳል።

MQA የKV መሸጎጫውን የሚቀነሰው በምን ምክንያት ነው?

ቁልፎች እና እሴቶች ከH ራሶች ወደ አንዱ ስለሚወድቁ መሸጎጫው በግምት የጭንቅላት ቆጠራ ይቀንሳል።

MQA ን ለመጠቀም ዋናው ግብይት ምንድነው?

ቁልፎችን እና እሴቶችን መጋራት የውክልና አቅምን በትንሹ ይቀንሳል፣ ይህም ለትልቅ የፍጥነት ግኝቶች ልውውጥ አነስተኛ ጥራት ያለው ቅናሽ ያስከትላል።

በመደበኛ ባለብዙ ጭንቅላት ትኩረት እና በMQA መካከል የተቀመጠው የትኛው ልዩነት ነው?

የቡድን-ጥያቄ ትኩረት (GQA) ጥራትን እና ፍጥነትን በማመጣጠን ከአንድ ይልቅ ብዙ የ KV ቡድኖችን ይጠቀማል።