Ntụziaka nka

KV cache Optimization

Ihe nchekwa KV na-echekwa igodo na ụkpụrụ nke igwe ngbanwe agbakọọlarị ka ọ ghara ịrụgharị ọrụ maka akara ọhụrụ ọ bụla - mana ọ nwere ike ịgbanye gigabytes.

2 nkeji na-agụEmelitere ikpeazụ

Nchịkọta

KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.

Ime miri emi

N'ime ihe ngbanwe, akara ọhụrụ ọ bụla na-aga akara ngosi niile gara aga site na igodo nlebara anya (K) na ụkpụrụ (V). Ịgbakọ K na V maka usoro niile na usoro ọ bụla ga-abụ akụkụ anọ na ihe efu, yabụ ụdị na-echekwa ha: cache KV. Ihe dị ala bụ nha. Ebe nchekwa ahụ na-eto n'ahịrị na ogologo usoro, nha batch, akwa na isi, yabụ arịrịọ ogologo okwu nwere ike iri ebe nchekwa GPU karịa karịa ihe atụ ahụ n'onwe ha. Nkwalite na-eme nke a site n'akụkụ dị iche iche: ebe nchekwa ibe (vLLM's PagedAttention) na-echekwa cache na ngọngọ na-adịghị agafe agafe iji kpochapụ nkewa ma mee ka ikekọrịta; quantization na-echekwa K na V na 8-bit ma ọ bụ 4-bit; na mgbanwe ụkpụrụ ụlọ dị ka Grouped-Query Attention (GQA) na Multi-Query Attention (MQA) mee ka ọtụtụ ndị isi ajụjụ kesaa isi igodo ole na ole / uru, na-egbutu nha cache na isi mmalite.

Nghọta nka nka

PagedNtị n'uche na-enweta paging memory-memory site na sistemu arụ ọrụ: cache na-ebi na blọk ndị edobere site na tebụl nyocha, yabụ arịrịọ na-eji naanị ngọngọ ha chọrọ yana prefixes yiri ya (dị ka usoro nkekọrịta ngwa ngwa) nwere ike na-arụtụ aka na otu ngọngọ. Multi-head Latent Attention (MLA), nke ejiri na ụdị DeepSeek, na-akpakọ K na V n'ime obere vector latent nkekọrịta, na-egbutu ebe nchekwa n'ụzọ dị egwu ma na-edobe izi ezi.

Mmetụta atụmatụ

Ọnụ ego na mmefu ego

Mkpebi ihe owuwu ụlọ na-akwalite arụmọrụ yana ọnụ ahịa ọrụ ruo ọtụtụ afọ.

Mkpebi doro anya

Nkà mmụta nka na-enyere ndị otu egwuregwu aka ịhọrọ nchịkọta ziri ezi, ọ bụghị naanị nke kachasị ọhụrụ.

Quality akara

Nhọrọ injinia ka mma na-ebelata ihe omume ntụkwasị obi na mmepụta.

Ọdịnihu nke nkwalite cache KV

Ka windo ndị gbara ya gburugburu na-agbatị ruo narị puku kwuru puku ma ọ bụ nde akara, cache KV na-aghọ ọnụ ahịa kacha mkpa nke ije ozi. Na-atụ anya mkpakọ cache dị egwu na nchụpụ (iwepụ akara nlebara anya dị ala), ịkekọrịta prefix arịrịọ dị ka ndabara, na-ebufe cache oyi na CPU ma ọ bụ NVMe, yana ihe owuwu dịka MLA na GQA na-aghọ ọkọlọtọ. Njikwa cache ga-adịwanye ka usoro ebe nchekwa zuru oke nwere ọkwa yana prefetching smart.

Mmejuputa n'ezie n'ụwa

vLLM's Paged nlebara anya na-eje ozi ọtụtụ mkparịta ụka na-emekọ ihe ọnụ site na ịkwakọba ihe mgbochi KV na-enweghị nkewa ebe nchekwa.

Nleba anya ajụjụ ọnụ nke agbakọtara na ụdị Llama na-ebelata ogo cache KV ka ogologo ọnọdụ dabara na ebe nchekwa GPU

Na-atụnye cache KV ka ọ bụrụ 8-bit (KV8) iji belata ebe nchekwa cache dị obere n'oge nchịkọta ogologo akwụkwọ.

Ndozi ihe nrịbama nke na-ejigharị KV blocks nke sistemụ kekọrịtara gafere ọtụtụ puku arịrịọ API

Ihe ize ndụ & okporo ụzọ nche

Ịkwalite otu akara ngosi nwere ike zoo adịghị ike sistemụ sara mbara.

A na-eledakarị ihe akụrụngwa na ụgwọ ọrụ anya.

Ọdịiche nchekwa na nleba anya nwere ike itolite ka sistemu na-adịwanye mgbagwoju anya.

Map mmejuputa

1

Kọwaa latency, ịdịmma na ebumnuche ọnụ ahịa tupu mmejuputa ya.

2

Benchmark n'okpuru ibu dị adị na ọnọdụ data.

3

Nleba anya akụrụngwa maka mperi, ịkpafu na mmetụta onye ọrụ.

4

Kwadebe ụzọ nzaghachi azụghachi azụ na ihe omume tupu ịchachaa.

Nọgide na-eme nchọpụta

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Malite ajụjụ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ajụjụ a na-ajụkarị

What is KV Cache Optimization?

Ihe nchekwa KV na-echekwa igodo na ụkpụrụ nke igwe ngbanwe agbakọọlarị ka ọ ghara ịrụgharị ọrụ maka akara ọhụrụ ọ bụla - mana ọ nwere ike ịgbanye gigabytes. KV cache kachasị mma na-ebelata ma na-ejikwa ebe nchekwa ahụ ka ụdị na-enye ọtụtụ ndị ọrụ ohere ogologo oge.

Kedu ihe nchekwa nchekwa KV na gịnị kpatara?

Igodo caching na ụkpụrụ sitere na akara ndị bu ụzọ na-ezere imegharị mgbako nlebara anya na akara ọhụrụ ọ bụla, na-echekwa oge.

Kedu ihe kpatara cache KV nwere ike bụrụ nsogbu ebe nchekwa?

Ihe nrịbama cache nwere ogologo okirikiri yana concurrency, yabụ ogologo arịrịọ nwere ike iji nnukwu ebe nchekwa GPU.

Kedu echiche sistemụ arụmọrụ PagedAttention na-agbaziri?

PagedNttention na-echekwa cache n'ime blọk na-abụghị nke etinyere na tebụl, dị ka paging OS.

Kedu ka Ajụjụ-ajụjụ ọnụ na nlebara anya ọtụtụ ajụjụ si ebelata nha cache KV?

Ịkekọrịta isi igodo/uru uru n'ofe ọtụtụ isi ajụjụ pụtara obere K na V vector dị ole na ole iji chekwaa.

Kedu otu uru nke ịkekọrịta prefix na cache KV?

Ngwa ngwa nkekọrịtara na-ewepụta ntinye KV yiri ya, yabụ ọtụtụ arịrịọ nwere ike tụọ aka na otu ngọngọ kama ịmegharị ha.