Lugha AI MWONGOZO

Kashe ya KV

Kache ya KV huhifadhi vidhibiti vya ufunguo na thamani ambayo transfoma tayari imekusanya tokeni za hapo awali, kwa hivyo sio lazima kuzirudisha kwa kila neno jipya linalotoa.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.

Dive ya kina

Transfoma hutengeneza maandishi tokeni moja kwa wakati mmoja, na kila safu ya tahadhari ya tokeni mpya inahitaji kulinganisha dhidi ya kila tokeni iliyotangulia. Utaratibu wa umakini hugeuza kila ishara kuwa hoja, ufunguo, na vekta ya thamani. Bila kuakibisha, kutengeneza nambari ya tokeni 1,000 kungemaanisha kukokotoa tena funguo na thamani kwa tokeni zote 999 za awali kwa kila hatua - kazi ya mara nne, ya ubadhirifu. Akiba ya KV huhifadhi vekta hizo za ufunguo na thamani baada ya kukokotwa kwanza na kuzitumia tena, kwa hivyo kila hatua mpya hukusanya vekta pekee kwa tokeni mpya zaidi na kuhudhuria kwenye akiba iliyohifadhiwa. Hii hupunguza gharama ya kila tokeni kutoka kuongeza urefu wa mfuatano hadi takriban mara kwa mara. Ubadilishanaji ni kumbukumbu: kashe hukua sawia na urefu wa muktadha, idadi ya tabaka, na vichwa vya umakini, mara nyingi huwa mtumiaji mkuu wa kumbukumbu katika huduma ya muktadha mrefu.

Ufahamu wa Kiufundi

Wakati wa awamu ya 'kujaza mapema' modeli huchakata arifa nzima na kujaza akiba; wakati wa 'decode' inaongeza tokeni moja ya K/V kwa kila hatua na inashikilia tena. Mizani ya ukubwa wa akiba kama 2 (K na V) × safu × vichwa × head_dim × sequence_length × bechi, katika usahihi uliochaguliwa. Ili kudhibiti hili, miundo ya kisasa hutumia uzingatiaji wa hoja za makundi au hoja nyingi kushiriki funguo/thamani kwenye vichwa vyote, na mifumo inayohudumia kama vLLM hutumia PagedAttention kutenga akiba katika vizuizi visivyoshikamana, kukata mgawanyiko na taka.

Athari za kimkakati

Kasi na kiwango

Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.

Kufikia na kufikia

Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.

Maamuzi ya wazi zaidi

Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.

Mustakabali wa Akiba ya KV

Madirisha ya muktadha yanapoenea hadi mamia ya maelfu ya ishara, kashe ya KV inakuwa kizuizi kikuu, kwa hivyo uvumbuzi ni mkali: ujanibishaji wa akiba hadi biti 8 au 4, sera za uondoaji ambazo hupunguza ishara za umuhimu wa chini, kushiriki kiambishi awali cha ombi tofauti, na kupakua kwa CPU au diski. Mabadiliko ya usanifu kama vile umakini wa fiche wa vichwa vingi hubana kache yenyewe. Tarajia uundaji mwenza unaoendelea wa anuwai za umakini na mifumo ya kumbukumbu inayolenga kutoa muktadha mrefu sana kwa bei nafuu na kwa uboreshaji wa juu.

Utekelezaji wa Ulimwengu Halisi

Kuharakisha majibu ya chatbot kwa kutumia tena vitufe/thamani zilizoakibishwa kutoka kwa historia ya mazungumzo badala ya kuyachakata tena kila zamu.

Uakibishaji wa kiambishi awali ambao unashiriki akiba kwa kidokezo cha mfumo mrefu kwa watumiaji wengi, kupunguza gharama na muda wa kusubiri.

PagedAttention ya vLLM inayosimamia akiba ya KV kwenye vizuizi ili kuhudumia maombi mengi ya wakati mmoja kwenye GPU moja kwa ufanisi.

Kuhesabu akiba ya KV ili kupunguza usahihi ili kutoshea miktadha mirefu kwenye kumbukumbu ndogo ya GPU.

Hatari & Walinzi

Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.

Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.

Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.

Ramani ya Utekelezaji

1

Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.

2

Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.

3

Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.

4

Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Uboreshaji wa Akiba ya KV

Maswali yanayoulizwa mara kwa mara

What is KV Cache?

Kache ya KV huhifadhi vidhibiti vya ufunguo na thamani ambayo transfoma tayari imekusanya tokeni za hapo awali, kwa hivyo sio lazima kuzirudisha kwa kila neno jipya linalotoa. Ndiyo sababu kubwa zaidi uundaji wa maandishi ni wa haraka - na jambo kuu ni kula kumbukumbu yako ya GPU wakati wa mazungumzo marefu.

Kashe ya KV inahifadhi nini?

Akiba ya KV hushikilia vidhibiti vya ufunguo na thamani kutoka kwa tokeni za awali ili uangalifu uweze kuzitumia tena badala ya kukokotoa tena.

Je, akiba ya KV hutatua tatizo gani kimsingi?

Bila kuweka akiba, kila tokeni mpya ingehitaji kukokotoa tena K/V kwa kila tokeni iliyotangulia, ambayo ni ubadhirifu; kache hufanya gharama ya kila ishara kuwa takriban mara kwa mara.

Ni nini upande wa chini wa kashe ya KV?

Akiba hukua na urefu wa mfuatano, safu, na vichwa, mara nyingi huwa mtumiaji mkuu wa kumbukumbu ya GPU katika huduma ya muktadha mrefu.

Ni mbinu gani inapunguza saizi ya akiba ya KV kwa kushiriki funguo na maadili kwenye vichwa vya umakini?

Hoja ya vikundi na umakini wa maswali mengi huruhusu vichwa vya hoja nyingi kushiriki seti chache za funguo/thamani, na kupunguza akiba kwa kiasi kikubwa.

Je! ni awamu gani mbili za uelekezaji wa kibadilishaji jamaa na kashe ya KV?

Kujaza mapema hujaza akiba na K/V ya kidokezo; kusimbua kunaongeza tokeni moja mpya ya K/V kila hatua na kushikilia tena kache.