የቡድን-የጥያቄ ትኩረት
የቡድን-መጠይቅ ትኩረት (GQA) በርከት ያሉ የመጠይቅ ራሶች አንድ አይነት ቁልፍ እና ዋጋ ያላቸውን ራሶች እንዲጋሩ በመፍቀድ በፅሁፍ ማመንጨት ጊዜ የሚፈለገውን ማህደረ ትውስታን የምንቀንስበት መንገድ ነው።
አጠቃላይ እይታ
It makes large models much faster to serve with almost no quality loss.
ጥልቅ ዳይቭ
በመደበኛ ባለብዙ ጭንቅላት ትኩረት ሽፋን እያንዳንዱ ጭንቅላት የራሱ ጥያቄዎች፣ ቁልፎች እና እሴቶች አሉት። በትውልድ ጊዜ፣ የቀደሙት ቶከኖች ሁሉ ቁልፎች እና እሴቶች የተሸጎጡ ናቸው ('KV cache') ስለዚህ ሞዴሉ እንደገና አይቆጥራቸውም። ከብዙ ጭንቅላት እና ረጅም አውዶች ጋር፣ ይህ መሸጎጫ በጣም ትልቅ ይሆናል እና በመረጃ ጊዜ የማህደረ ትውስታ ባንድዊድዝ ይቆጣጠራል። GQA፣ በGoogle ተመራማሪዎች በ2023 አስተዋወቀ፣ የመጠይቁን ራሶች በቡድን በማድረግ ለእያንዳንዱ ቡድን አንድ የጋራ ቁልፍ እና እሴት ራሶች ይሰጣታል። 32 መጠይቅ ራሶች ካሉህ ግን 8 KV ቡድኖች ብቻ፣ የKV መሸጎጫ በአራት እጥፍ ያህል ይቀንሳል። ይህ በባለብዙ ጭንቅላት ትኩረት (በእያንዳንዱ ጭንቅላት የተለየ) እና ባለብዙ መጠይቅ ትኩረት (አንድ የተጋራ KV ለሁሉም ራሶች) መካከል ይቀመጣል፣ ጥራቱን ወደ ሙሉ ትኩረት ሲይዝ አብዛኛውን የMQA ፍጥነት ይይዛል። ላማ 2 70ቢ እና ብዙ በኋላ ሞዴሎች ተቀብለውታል።
ቴክኒካዊ ግንዛቤ
የትኩረት ጥራት ብዙ የተለያዩ የጥያቄ አቅጣጫዎችን በማግኘት ላይ በእጅጉ የተመካ ነው፣ ነገር ግን ቁልፎችን እና እሴቶቹን መጋራትን ይታገሣል። GQA ይህንን ተመሳሳይነት ይጠቀማል፡ ሁሉንም የመጠይቅ ጭንቅላት ያስቀምጣል ነገር ግን እያንዳንዱን የተጋራ የKV ጭንቅላት በቡድኑ ውስጥ ያሉትን ጥያቄዎች ይደግማል። ቁጠባው በምርመራው ይመጣል፣ የ KV መሸጎጫ ዋናው የማህደረ ትውስታ ባንድዊድዝ ተጠቃሚ ነው። ያነሱ የKV ራሶች ማለት በአንድ የመነጨ ማስመሰያ የሚነበበው ያነሰ ውሂብ ማለት ነው። ባለ ብዙ ጭንቅላት ፍተሻ ነጥብ ወደ GQA ለመቀየር ሞዴሎች ብዙ ጊዜ 'በሰለጠነ' ይዘጋጃሉ።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የቡድን-መጠይቅ ትኩረት የወደፊት
GQA አሁን በክፍት ክብደት ሞዴሎች ውስጥ መደበኛ ነባሪ ነው ምክንያቱም ለትልቅ አገልግሎት ድሎች አነስተኛ ጥራት ያለው ወጪን በንጽህና ስለሚሸጥ። እንደ FlashAttention፣ KV-cache quantization፣ እና እንደ ባለ ብዙ ጭንቅላት ድብቅ ትኩረት ካሉ ሌሎች የቅልጥፍና ዘዴዎች ጋር ከጊዜ ወደ ጊዜ መሸጎጫውን የበለጠ እንዲያጣምር ይጠብቁ። የአውድ መስኮቶች እያደጉ ሲሄዱ፣ የKV-cache መጠንን መቆጣጠር ማዕከላዊ የንድፍ ችግር ሆኖ ይቀራል፣ እና የGQA-style ጭንቅላት መጋራት እንደ ቁልፍ ማንሻ ይቀራል።
የእውነተኛ-ዓለም አተገባበር
Llama 2 70B እና Llama 3 GQA ን በመጠቀም ረጅም አውድ በትንሽ ኬቪ መሸጎጫ ለማገልገል
ትልቅ የውይይት ሞዴል ባነሰ ወይም ርካሽ በሆነ ፍጥነት እንዲገጣጠም የጂፒዩ ማህደረ ትውስታን መቀነስ
የ KV-cache ባንድዊድዝ ማነቆ በሆነበት በምርት ኤፒአይዎች ውስጥ ማስመሰያ-በቶከን ማፍጠን
የማስታወስ ችሎታን ሳያሟጥጡ ብዙ ተጠቃሚዎችን በአንድ ጊዜ ለማገልገል ትላልቅ ባች መጠኖችን ማንቃት
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የብዝሃ-ጥያቄ ትኩረት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Grouped-Query Attention?
የቡድን-መጠይቅ ትኩረት (GQA) በርከት ያሉ የመጠይቅ ራሶች አንድ አይነት ቁልፍ እና ዋጋ ያላቸውን ራሶች እንዲጋሩ በመፍቀድ በፅሁፍ ማመንጨት ጊዜ የሚፈለገውን ማህደረ ትውስታን የምንቀንስበት መንገድ ነው። ትላልቅ ሞዴሎችን ከሞላ ጎደል ጥራት ማጣት ጋር ለማገልገል በጣም ፈጣን ያደርገዋል.
በቡድን-መጠይቅ ትኩረት፣ በጥያቄ መሪዎች ቡድን መካከል ምን ይጋራል?
GQA የተለየ የመጠይቅ ራሶችን ይይዛል ነገር ግን እያንዳንዱ ቡድን አንድ ቁልፍ እና እሴት ራሶች እንዲያካፍሉ ያስችላቸዋል፣ ይህም የKV መሸጎጫውን ይቀንሳል።
GQA በየትኞቹ ሁለት ጽንፎች መካከል እንደ መካከለኛ ቦታ በደንብ ተገልጿል?
ባለብዙ ጭንቅላት ለእያንዳንዱ ጭንቅላት KV ይሰጣል; ባለብዙ መጠይቅ ለሁሉም ራሶች አንድ KV ያካፍላል; GQA ከጥቂት የKV ቡድኖች ጋር ተቀምጧል።
GQA በዋነኛነት ርካሽ የሚያደርገው የትኛውን የውሳኔ ክፍል ነው?
ቁጠባው በትውልድ ጊዜ ይታያል፣ የ KV መሸጎጫ ማንበብ ዋነኛው የማህደረ ትውስታ-ባንድዊድዝ ወጪ ነው።
አንድ ሞዴል 32 የመጠይቅ ራሶች እና 8 ኪሎ ቮልት ቡድኖች ካሉት፣ የKV መሸጎጫ በምን ምክንያት ይቀንሳል?
32 የመጠይቅ ራሶች በ8 የተጋሩ የKV ቡድኖች የተሸጎጡ ቁልፎችን እና እሴቶችን በአራት እጥፍ ያህል ይቀንሳል።
ለምንድነው GQA የ KV ራሶችን ቢያጋራም አብዛኛው የአምሳያው ጥራት መጠበቅ የሚችለው?
ትኩረት የተለያዩ የጥያቄ አቅጣጫዎችን ከማጣት ይልቅ ቁልፎችን እና እሴቶችን ማጋራትን ይታገሣል፣ ስለዚህ GQA ጥራቱን ከፍ ያደርገዋል።