Kashe ya KV
Kache ya KV huhifadhi vidhibiti vya ufunguo na thamani ambayo transfoma tayari imekusanya tokeni za hapo awali, kwa hivyo sio lazima kuzirudisha kwa kila neno jipya linalotoa.
Muhtasari
It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.
Dive ya kina
Transfoma hutengeneza maandishi tokeni moja kwa wakati mmoja, na kila safu ya tahadhari ya tokeni mpya inahitaji kulinganisha dhidi ya kila tokeni iliyotangulia. Utaratibu wa umakini hugeuza kila ishara kuwa hoja, ufunguo, na vekta ya thamani. Bila kuakibisha, kutengeneza nambari ya tokeni 1,000 kungemaanisha kukokotoa tena funguo na thamani kwa tokeni zote 999 za awali kwa kila hatua - kazi ya mara nne, ya ubadhirifu. Akiba ya KV huhifadhi vekta hizo za ufunguo na thamani baada ya kukokotwa kwanza na kuzitumia tena, kwa hivyo kila hatua mpya hukusanya vekta pekee kwa tokeni mpya zaidi na kuhudhuria kwenye akiba iliyohifadhiwa. Hii hupunguza gharama ya kila tokeni kutoka kuongeza urefu wa mfuatano hadi takriban mara kwa mara. Ubadilishanaji ni kumbukumbu: kashe hukua sawia na urefu wa muktadha, idadi ya tabaka, na vichwa vya umakini, mara nyingi huwa mtumiaji mkuu wa kumbukumbu katika huduma ya muktadha mrefu.
Ufahamu wa Kiufundi
Wakati wa awamu ya 'kujaza mapema' modeli huchakata arifa nzima na kujaza akiba; wakati wa 'decode' inaongeza tokeni moja ya K/V kwa kila hatua na inashikilia tena. Mizani ya ukubwa wa akiba kama 2 (K na V) × safu × vichwa × head_dim × sequence_length × bechi, katika usahihi uliochaguliwa. Ili kudhibiti hili, miundo ya kisasa hutumia uzingatiaji wa hoja za makundi au hoja nyingi kushiriki funguo/thamani kwenye vichwa vyote, na mifumo inayohudumia kama vLLM hutumia PagedAttention kutenga akiba katika vizuizi visivyoshikamana, kukata mgawanyiko na taka.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Akiba ya KV
Madirisha ya muktadha yanapoenea hadi mamia ya maelfu ya ishara, kashe ya KV inakuwa kizuizi kikuu, kwa hivyo uvumbuzi ni mkali: ujanibishaji wa akiba hadi biti 8 au 4, sera za uondoaji ambazo hupunguza ishara za umuhimu wa chini, kushiriki kiambishi awali cha ombi tofauti, na kupakua kwa CPU au diski. Mabadiliko ya usanifu kama vile umakini wa fiche wa vichwa vingi hubana kache yenyewe. Tarajia uundaji mwenza unaoendelea wa anuwai za umakini na mifumo ya kumbukumbu inayolenga kutoa muktadha mrefu sana kwa bei nafuu na kwa uboreshaji wa juu.
Utekelezaji wa Ulimwengu Halisi
Kuharakisha majibu ya chatbot kwa kutumia tena vitufe/thamani zilizoakibishwa kutoka kwa historia ya mazungumzo badala ya kuyachakata tena kila zamu.
Uakibishaji wa kiambishi awali ambao unashiriki akiba kwa kidokezo cha mfumo mrefu kwa watumiaji wengi, kupunguza gharama na muda wa kusubiri.
PagedAttention ya vLLM inayosimamia akiba ya KV kwenye vizuizi ili kuhudumia maombi mengi ya wakati mmoja kwenye GPU moja kwa ufanisi.
Kuhesabu akiba ya KV ili kupunguza usahihi ili kutoshea miktadha mirefu kwenye kumbukumbu ndogo ya GPU.
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Uboreshaji wa Akiba ya KV
Maswali yanayoulizwa mara kwa mara
What is KV Cache?
Kache ya KV huhifadhi vidhibiti vya ufunguo na thamani ambayo transfoma tayari imekusanya tokeni za hapo awali, kwa hivyo sio lazima kuzirudisha kwa kila neno jipya linalotoa. Ndiyo sababu kubwa zaidi uundaji wa maandishi ni wa haraka - na jambo kuu ni kula kumbukumbu yako ya GPU wakati wa mazungumzo marefu.
Kashe ya KV inahifadhi nini?
Akiba ya KV hushikilia vidhibiti vya ufunguo na thamani kutoka kwa tokeni za awali ili uangalifu uweze kuzitumia tena badala ya kukokotoa tena.
Je, akiba ya KV hutatua tatizo gani kimsingi?
Bila kuweka akiba, kila tokeni mpya ingehitaji kukokotoa tena K/V kwa kila tokeni iliyotangulia, ambayo ni ubadhirifu; kache hufanya gharama ya kila ishara kuwa takriban mara kwa mara.
Ni nini upande wa chini wa kashe ya KV?
Akiba hukua na urefu wa mfuatano, safu, na vichwa, mara nyingi huwa mtumiaji mkuu wa kumbukumbu ya GPU katika huduma ya muktadha mrefu.
Ni mbinu gani inapunguza saizi ya akiba ya KV kwa kushiriki funguo na maadili kwenye vichwa vya umakini?
Hoja ya vikundi na umakini wa maswali mengi huruhusu vichwa vya hoja nyingi kushiriki seti chache za funguo/thamani, na kupunguza akiba kwa kiasi kikubwa.
Je! ni awamu gani mbili za uelekezaji wa kibadilishaji jamaa na kashe ya KV?
Kujaza mapema hujaza akiba na K/V ya kidokezo; kusimbua kunaongeza tokeni moja mpya ya K/V kila hatua na kushikilia tena kache.