KV መሸጎጫ ማመቻቸት
የKV መሸጎጫ አንድ ትራንስፎርመር ያሰላቸው ቁልፎችን እና እሴቶችን ያከማቻል ስለዚህ ለእያንዳንዱ አዲስ ማስመሰያ አይሰራም - ግን እስከ ጊጋባይት ድረስ ፊኛ ማድረግ ይችላል።
አጠቃላይ እይታ
KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.
ጥልቅ ዳይቭ
በትራንስፎርመር ውስጥ፣ እያንዳንዱ አዲስ ማስመሰያ ሁሉንም የቀደመ ቶከኖች ትኩረትን ቁልፎች (K) እና እሴቶች (V) በኩል ይከታተላል። ለጠቅላላው ቅደም ተከተል በእያንዳንዱ እርምጃ K እና V እንደገና ማስላት አራት እና ብክነት ስለሚኖረው ሞዴሎች ይሸፍኗቸዋል-የ KV መሸጎጫ። ጉዳቱ መጠን ነው። መሸጎጫው በቅደም ተከተል ርዝመት፣ ባች መጠን፣ ንብርብሮች እና ራሶች በመስመር ያድጋል፣ ስለዚህ የረጅም ጊዜ አውድ ጥያቄ ከአምሳያው ክብደት የበለጠ የጂፒዩ ማህደረ ትውስታን ሊፈጅ ይችላል። ማመቻቸት ይህንን ከበርካታ ማዕዘኖች ይፈታል፡ የገጽ ማህደረ ትውስታ (vLLM's PagedAttention) መቆራረጥን ለማስወገድ እና መጋራትን ለማንቃት መሸጎጫውን በማያያዙ ብሎኮች ውስጥ ያከማቻል። የኳንቴሽን መደብሮች K እና V በ 8-ቢት ወይም 4-ቢት; እና እንደ የቡድን-መጠይቅ ትኩረት (GQA) እና ባለብዙ መጠይቅ ትኩረት (MQA) ያሉ የስነ-ህንፃ ለውጦች ብዙ የመጠይቅ ራሶች ያነሱ ቁልፍ/ዋጋ ራሶችን እንዲያካፍሉ እና የመሸጎጫውን መጠን ከምንጩ ላይ እንዲቆርጡ ያስችላቸዋል።
ቴክኒካዊ ግንዛቤ
PagedAttention ቨርቹዋል ሜሞሪ ፔጅ ከኦፕሬቲንግ ሲስተሞች ተበድሯል፡ መሸጎጫው የሚኖረው በፍለጋ ሠንጠረዥ ውስጥ በተቀረጹ ቋሚ መጠን ባላቸው ብሎኮች ነው፣ ስለዚህ ጥያቄዎች የሚፈልጓቸውን ብሎኮች ብቻ ይጠቀማሉ እና ተመሳሳይ ቅድመ ቅጥያ (ልክ እንደ የጋራ የስርዓት ጥያቄ) ተመሳሳይ ብሎኮችን ሊያመለክቱ ይችላሉ። ባለብዙ ጭንቅላት ድብቅ ትኩረት (ኤምኤልኤ)፣ በ DeepSeek ሞዴሎች ውስጥ ጥቅም ላይ የዋለው K እና Vን ወደ ትንሽ የጋራ ድብቅ ቬክተር ይጭናል፣ ትክክለኛነትን እየጠበቀ ማህደረ ትውስታን በሚያስደንቅ ሁኔታ ይቆርጣል።
ስልታዊ ተጽእኖ
ወጪ እና በጀት
የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.
ግልጽ ውሳኔዎች
የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።
የጥራት ቁጥጥር
የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.
የKV መሸጎጫ ማመቻቸት የወደፊት ዕጣ
የአውድ መስኮቶች ወደ መቶ ሺዎች ወይም በሚሊዮኖች የሚቆጠሩ ቶከኖች ሲዘረጉ፣የKV cache ዋናው የማገልገል ዋጋ ይሆናል። ኃይለኛ መሸጎጫ መጭመቅ እና ማስወጣት (አነስተኛ ትኩረት የሚሰጡ ቶከኖችን መጣል)፣ የመስቀል ጥያቄ ቅድመ ቅጥያ እንደ ነባሪ ማጋራት፣ ቀዝቃዛ መሸጎጫ ወደ ሲፒዩ ወይም NVMe ማውረድ እና እንደ MLA እና GQA ያሉ አርክቴክቸር መደበኛ ይሆናሉ። የመሸጎጫ አስተዳደር ከጊዜ ወደ ጊዜ ከደረጃዎች እና ከብልጥ ቅድመ ዝግጅት ጋር ሙሉ የማህደረ ትውስታ ተዋረድን ይመስላል።
የእውነተኛ-ዓለም አተገባበር
የVLLM ፔጅድ ትኩረት የ KV ብሎኮችን ያለ ማህደረ ትውስታ መቆራረጥ በማሸግ ብዙ ጊዜያዊ የውይይት ክፍለ ጊዜዎችን ያቀርባል
የቡድን-መጠይቅ ትኩረት በላማ ሞዴሎች የKV መሸጎጫ መጠንን ስለሚቀንስ ረዘም ያሉ አውዶች ከጂፒዩ ማህደረ ትውስታ ጋር ይጣጣማሉ
በረዥም ሰነድ ማጠቃለያ ወቅት የ KV መሸጎጫውን ወደ 8-ቢት (KV8) በመለካት የመሸጎጫ ማህደረ ትውስታን በግማሽ ለመቀነስ።
በሺዎች በሚቆጠሩ የኤፒአይ ጥያቄዎች ላይ የKV ብሎኮችን የጋራ ስርዓት ጥያቄን እንደገና የሚጠቀም መሸጎጫ ቅድመ ቅጥያ
አደጋዎች እና የጥበቃ መንገዶች
አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።
የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.
ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።
ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።
ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።
ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
KV መሸጎጫ
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is KV Cache Optimization?
የKV መሸጎጫ አንድ ትራንስፎርመር ያሰላቸው ቁልፎችን እና እሴቶችን ያከማቻል ስለዚህ ለእያንዳንዱ አዲስ ማስመሰያ አይሰራም - ግን እስከ ጊጋባይት ድረስ ፊኛ ማድረግ ይችላል። የKV መሸጎጫ ማመቻቸት ይቀንሳል እና ያንን ማህደረ ትውስታ ያስተዳድራል ስለዚህ ሞዴሎች ረዘም ያለ አውድ ለብዙ ተጠቃሚዎች በአንድ ጊዜ ያገለግላሉ።
የ KV መሸጎጫ ምን ያከማቻል እና ለምን?
ከቀድሞ ቶከኖች ቁልፎችን እና እሴቶችን መሸጎጥ በእያንዳንዱ አዲስ ማስመሰያ ላይ የትኩረት ማስላትን ከመድገም ይቆጠባል።
የ KV መሸጎጫ ለምን የማስታወስ ችግር ሊሆን ይችላል?
የመሸጎጫ መጠን ሚዛኖች ከአውድ ርዝመት እና ተመሳሳይነት ጋር፣ ስለዚህ ረጅም ጥያቄዎች እጅግ በጣም ብዙ የጂፒዩ ማህደረ ትውስታን መጠቀም ይችላሉ።
PagedAttention የሚበደረው የትኛውን የስርዓተ ክወና ፅንሰ-ሀሳብ ነው?
PagedAttention መሸጎጫውን ልክ እንደ የስርዓተ ክወና ገጽ (OS) በካርታ በተዘጋጁ ቋሚ መጠን ባልሆኑ ብሎኮች ያከማቻል።
የቡድን-መጠይቅ እና ባለብዙ መጠይቅ ትኩረት የKV መሸጎጫ መጠን እንዴት ይቀንሳል?
በበርካታ የመጠይቅ ራሶች ላይ የቁልፍ/ዋጋ ጭንቅላትን ማጋራት ማለት ለማከማቸት በጣም ያነሰ የ K እና V ቬክተሮች ማለት ነው።
በKV መሸጎጫ ውስጥ የቅድመ-ቅጥያ መጋራት አንዱ ጥቅም ምንድነው?
የተጋራ የስርዓት መጠየቂያ ተመሳሳይ የKV ግቤቶችን ይፈጥራል፣ ስለዚህ ብዙ ጥያቄዎች እነሱን ከማባዛት ይልቅ ወደ ተመሳሳይ ብሎኮች ሊያመለክቱ ይችላሉ።