የቋንቋ AI መመሪያ

KV መሸጎጫ

የ KV መሸጎጫ አንድ ትራንስፎርመር አስቀድሞ ለቀደሙት ቶከኖች ያሰላቸው ቁልፍ እና ዋጋ ያላቸውን ቬክተሮች ያከማቻል፣ ስለዚህ ለሚያመነጨው እያንዳንዱ አዲስ ቃል እንደገና ማስላት አያስፈልገውም።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.

ጥልቅ ዳይቭ

ትራንስፎርመሮች ጽሑፍ በአንድ ጊዜ አንድ ማስመሰያ ያመነጫሉ፣ እና እያንዳንዱ አዲስ የማስመሰያ ትኩረት ሽፋን ከእያንዳንዱ ቀዳሚ ማስመሰያ ጋር ማወዳደር አለበት። የትኩረት ዘዴ እያንዳንዱን ማስመሰያ ወደ መጠይቅ፣ ቁልፍ እና እሴት ቬክተር ይለውጠዋል። መሸጎጫ ከሌለ ማስመሰያ ቁጥር 1,000 ማመንጨት ማለት ለ999 ቀደምት ቶከኖች በእያንዳንዱ እርምጃ ቁልፎችን እና እሴቶችን እንደገና ማስላት ማለት ነው - ኳድራቲክ ፣ አባካኝ ሥራ። የKV መሸጎጫ እነዚያ ቁልፍ እና ዋጋ ያላቸው ቬክተሮች መጀመሪያ ከተሰሉ በኋላ እንደገና ጥቅም ላይ ከዋሉ በኋላ ያስቀምጣቸዋል፣ ስለዚህ እያንዳንዱ አዲስ እርምጃ ቬክተሮችን ለአዲሱ ቶከን ያሰላል እና በተከማቸ መሸጎጫ ውስጥ ይከታተላል። ይህ በቅደም ተከተል ርዝመት ካለው ልኬት ወደ ቋሚ ቋሚነት የአንድ-ቶከን ወጪ ይቀንሳል። ግብይቱ የማስታወስ ችሎታ ነው፡ መሸጎጫው በአውድ ርዝመት፣ በንብርብሮች ብዛት እና ትኩረት በሚሰጥ ራስ ላይ በመስመራዊ ያድጋል፣ ብዙ ጊዜ በረጅም አውድ አገልግሎት ውስጥ ዋና ማህደረ ትውስታ ተጠቃሚ ይሆናል።

ቴክኒካዊ ግንዛቤ

በ'ቅድመ-ሙላ' ደረጃ ሞዴሉ አጠቃላይ ጥያቄውን ያስኬዳል እና መሸጎጫውን ይሞላል። በ'ዲኮድ' ጊዜ በእያንዳንዱ እርምጃ አንድ ማስመሰያ K/V ይጨምርና እንደገና ይከታተላል። የመሸጎጫ መጠን ሚዛኖች እንደ 2 (K እና V) × ንብርብሮች × ራሶች × head_dim × ተከታታይ_ርዝመት × ባች፣ በተመረጠው ትክክለኛነት። ይህንን ለመግራት፣ ዘመናዊ ሞዴሎች በቡድን የተሰባሰቡ መጠይቅን ወይም ባለብዙ መጠይቅ ትኩረትን በጭንቅላት ላይ ቁልፎችን/እሴቶችን ለመጋራት ይጠቀማሉ፣ እና እንደ vLLM ያሉ ማገልገል ስርዓቶች PagedAttentionን በመጠቀም መሸጎጫ ባልሆኑ ብሎኮች ውስጥ ለመመደብ፣ ቁርጥራጭ እና ቆሻሻን ይቆርጣሉ።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።

መድረስ እና መድረስ

በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።

ግልጽ ውሳኔዎች

አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።

የ KV መሸጎጫ የወደፊት

የአውድ መስኮቶች ወደ በመቶ ሺዎች የሚቆጠሩ ቶከኖች ሲዘረጉ፣የKV cache ማዕከላዊ ማነቆ ይሆናል፣ስለዚህ ፈጠራው ጨካኝ ነው፡የመሸጎጫ መጠን ወደ 8 ወይም 4 ቢት፣አነስተኛ ጠቀሜታ ያላቸውን ቶከኖች የሚጥሉ የማስወጣት ፖሊሲዎች፣የቅድመ ቅጥያ መጋራት እና ወደ ሲፒዩ ወይም ዲስክ ማውረድ። እንደ ባለብዙ ጭንቅላት ድብቅ ትኩረት ያሉ የስነ-ህንፃ ለውጦች መሸጎጫውን እራሱ ያጨቁታል። በጣም ረጅም አውዶችን በርካሽ እና በከፍተኛ ፍጥነት ለማገልገል ያለመ የትኩረት ተለዋጮች እና የማህደረ ትውስታ ስርዓቶች ቀጣይ የጋራ ንድፍ ይጠብቁ።

የእውነተኛ-ዓለም አተገባበር

የውይይት ቦት ምላሾችን ማፋጠን እያንዳንዱን ተራ ከማዘጋጀት ይልቅ የተሸጎጡ ቁልፎችን/እሴቶችን በውይይት ታሪክ እንደገና በመጠቀም።

መሸጎጫውን ለብዙ ተጠቃሚዎች ረጅም የስርዓት ጥያቄን የሚያጋራ ቅድመ ቅጥያ ዋጋን እና መዘግየትን ይቀንሳል።

በአንድ ጂፒዩ ላይ ብዙ ተመሳሳይ ጥያቄዎችን በብቃት ለማቅረብ የVLLM Paged ትኩረት የKV መሸጎጫ በብሎኮች ማስተዳደር።

ረጅም አውዶችን ከተገደበ የጂፒዩ ማህደረ ትውስታ ጋር ለማስማማት የKV መሸጎጫውን ወደ ትክክለኝነት ዝቅ ማድረግ።

አደጋዎች እና የጥበቃ መንገዶች

የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።

ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።

የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።

የትግበራ ፍኖተ ካርታ

1

ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።

2

ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።

3

ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።

4

የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is KV Cache?

የ KV መሸጎጫ አንድ ትራንስፎርመር አስቀድሞ ለቀደሙት ቶከኖች ያሰላቸው ቁልፍ እና ዋጋ ያላቸውን ቬክተሮች ያከማቻል፣ ስለዚህ ለሚያመነጨው እያንዳንዱ አዲስ ቃል እንደገና ማስላት አያስፈልገውም። የጽሑፍ ማመንጨት ፈጣን የሚሆንበት ብቸኛው ትልቁ ምክንያት ነው - እና በረጅም ንግግሮች ጊዜ የጂፒዩ ማህደረ ትውስታዎን የሚበላው ዋናው ነገር።

የKV መሸጎጫ ምን ያከማቻል?

የKV መሸጎጫ ቁልፉን እና እሴት ቬክተሮችን ከቀደምት ቶከኖች ስለሚይዝ ትኩረት እንደገና ከመቁጠር ይልቅ እንደገና ሊጠቀምባቸው ይችላል።

የ KV መሸጎጫ በዋነኝነት የሚፈታው የትኛውን ችግር ነው?

ያለ መሸጎጫ፣ እያንዳንዱ አዲስ ማስመሰያ ለእያንዳንዱ የቀደመ ማስመሰያ K/V እንደገና ማስላት ያስፈልገዋል፣ ይህም አባካኝ ነው። መሸጎጫው በአንድ ማስመሰያ ወጪ በግምት ቋሚ ያደርገዋል።

የ KV መሸጎጫ ዋነኛው ኪሳራ ምንድነው?

መሸጎጫው በቅደም ተከተል ርዝመት፣ በንብርብሮች እና ጭንቅላት ያድጋል፣ ብዙ ጊዜ በረጅም አውድ አገልግሎት ውስጥ የጂፒዩ ማህደረ ትውስታ ዋና ተጠቃሚ ይሆናል።

በትኩረት ራሶች ውስጥ ቁልፎችን እና እሴቶችን በማጋራት የ KV መሸጎጫ መጠንን የሚቀንስ የትኛው ዘዴ ነው?

የቡድን-መጠይቅ እና የብዝሃ-ጥያቄ ትኩረት በርካታ የመጠይቅ ራሶች ያነሱ የቁልፍ/የዋጋ ስብስቦችን እንዲጋሩ ያስችላቸዋል፣ይህም መሸጎጫውን በእጅጉ ይቀንሳል።

ከKV መሸጎጫ አንፃር ሁለቱ የትራንስፎርመር ኢንፈረንስ ምን ምን ናቸው?

ቅድመ-ሙላ መሸጎጫውን በጥያቄው K/V ይሞላል። ኮድ መፍታት በእያንዳንዱ እርምጃ አንድ አዲስ ማስመሰያ K/V ይጨመራል እና መሸጎጫውን እንደገና ይከታተላል።