MWONGOZO wa Kiufundi

Uboreshaji wa Akiba ya KV

Akiba ya KV huhifadhi funguo na thamani ambazo kibadilishaji kibadilishaji tayari kimekokotoa kwa hivyo haifanyi kazi tena kwa kila ishara mpya - lakini inaweza kupakia kwenye gigabaiti.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.

Dive ya kina

Katika kibadilishaji kubadilisha fedha, kila tokeni mpya hushughulikia tokeni zote zilizopita kupitia vitufe vya kuzingatia (K) na thamani (V). Kurejelea K na V kwa mlolongo mzima katika kila hatua itakuwa ya thamani na ya upotevu, kwa hivyo modeli huzihifadhi: kashe ya KV. Ubaya ni saizi. Akiba hukua kimstari kwa urefu wa mfuatano, saizi ya bechi, safu na vichwa, kwa hivyo ombi la muktadha mrefu linaweza kutumia kumbukumbu zaidi ya GPU kuliko uzani wa muundo wenyewe. Uboreshaji hushughulikia hili kutoka kwa pembe kadhaa: kumbukumbu iliyopangwa (PagedAttention ya vLLM) huhifadhi akiba katika vizuizi visivyo na uhusiano ili kuondoa mgawanyiko na kuwezesha kushiriki; maduka ya quantization K na V katika 8-bit au 4-bit; na mabadiliko ya usanifu kama vile Umakini wa Maswali ya Kundi (GQA) na Uangalifu wa Maswali Mengi (MQA) huruhusu vichwa vingi vya hoja kushiriki vichwa vichache vya vitufe/thamani, kufyeka saizi ya akiba kwenye chanzo.

Ufahamu wa Kiufundi

PagedAttention hukopa paging ya kumbukumbu-pepe kutoka kwa mifumo ya uendeshaji: kashe huishi katika vizuizi vya ukubwa usiobadilika vilivyopangwa kupitia jedwali la kutazama, kwa hivyo maombi hutumia tu vizuizi vinavyohitaji na viambishi awali vinavyofanana (kama kidokezo cha mfumo ulioshirikiwa) vinaweza kuelekeza kwenye vizuizi sawa. Multi-head Latent Attention (MLA), inayotumiwa katika miundo ya DeepSeek, inabana K na V kwenye vekta ndogo iliyofichwa iliyoshirikiwa, inayokata kumbukumbu kwa kiasi kikubwa huku ikihifadhi usahihi.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa Uboreshaji wa Akiba ya KV

Madirisha ya muktadha yanapoenea hadi mamia ya maelfu au mamilioni ya tokeni, kashe ya KV inakuwa gharama kuu ya kutoa huduma. Tarajia mgandamizo mkali wa akiba na uhamishaji (kuacha ishara zenye umakini mdogo), kushiriki kiambishi awali cha ombi tofauti kama chaguo-msingi, kupakua akiba baridi kwenye CPU au NVMe, na usanifu kama vile MLA na GQA kuwa kawaida. Udhibiti wa akiba utazidi kufanana na safu kamili ya kumbukumbu iliyo na viwango na uletaji mahiri.

Utekelezaji wa Ulimwengu Halisi

PagedAttention ya vLLM inayohudumia vipindi vingi vya gumzo kwa wakati mmoja kwa kufunga vizuizi vya KV bila kugawanyika kwa kumbukumbu.

Uangalifu wa Hoja-ya Kikundi katika miundo ya Llama inayopunguza ukubwa wa akiba ya KV ili miktadha mirefu kutoshea kumbukumbu ya GPU

Kukadiria kashe ya KV hadi 8-bit (KV8) ili kupunguza takriban nusu ya kumbukumbu ya akiba wakati wa muhtasari wa hati ndefu.

Akiba ya kiambishi awali ambacho kinatumia tena vizuizi vya KV vya kidokezo cha mfumo ulioshirikiwa katika maelfu ya maombi ya API

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Maswali yanayoulizwa mara kwa mara

What is KV Cache Optimization?

Akiba ya KV huhifadhi funguo na thamani ambazo kibadilishaji kibadilishaji tayari kimekokotoa kwa hivyo haifanyi kazi tena kwa kila ishara mpya - lakini inaweza kupakia kwenye gigabaiti. Uboreshaji wa akiba ya KV hupungua na kudhibiti kumbukumbu hiyo kwa hivyo miundo itumike miktadha mirefu kwa watumiaji zaidi kwa wakati mmoja.

Kashe ya KV huhifadhi nini na kwa nini?

Vifunguo vya kuweka akiba na thamani kutoka kwa tokeni za awali huepuka kufanya tena hesabu ya umakini kwenye kila tokeni mpya, kuokoa muda.

Kwa nini kashe ya KV inaweza kuwa shida ya kumbukumbu?

Mizani ya ukubwa wa akiba yenye urefu wa muktadha na upatanifu, hivyo maombi marefu yanaweza kutumia kiasi kikubwa cha kumbukumbu ya GPU.

Je, ni dhana gani ya mfumo wa uendeshaji ambayo PagedAttention inakopa?

PagedAttention huhifadhi akiba katika vizuizi vya saizi maalum zisizo shikamana zilizopangwa kupitia jedwali, kama vile ukurasa wa OS.

Je, Maswali ya Kikundi na Umakini wa Maswali mengi hupunguza vipi saizi ya akiba ya KV?

Kushiriki vichwa vya vitufe/thamani kwenye vichwa vingi vya hoja kunamaanisha kuwa ni vekta chache zaidi za K na V za kuhifadhi.

Je, ni faida gani moja ya kushiriki kiambishi awali kwenye kashe ya KV?

Kidokezo cha mfumo ulioshirikiwa hutoa maingizo ya KV yanayofanana, kwa hivyo maombi mengi yanaweza kuelekeza kwenye vizuizi sawa badala ya kuvinakili.