Uangalifu wa Vichwa Vingi
Multi-Head Latent Attention (MLA) ni utaratibu wa usikivu, ulioletwa katika DeepSeek-V2, ambao unabana akiba ya ufunguo wenye njaa ya kumbukumbu kuwa vekta ndogo iliyofichika iliyoshirikiwa.
Muhtasari
Huruhusu miundo mikubwa ya lugha kuendesha na kumbukumbu ndogo zaidi ya GPU huku ikiweka ubora karibu na umakini wa kawaida.
Dive ya kina
Transfoma inapozalisha maandishi, huhifadhi vekta ya ufunguo na thamani kwa kila tokeni iliyopita katika 'kache ya KV.' Akiba hiyo inakua na urefu wa muktadha na inatawala utumiaji wa kumbukumbu wakati wa uelekezaji. MLA hubadilisha vekta nyingi za ukubwa kamili wa vitufe/thamani na vekta moja ya hali ya chini iliyofichika kwa kila tokeni, kisha miradi ambayo imefichwa kwenye vitufe vya kila kichwa na thamani kwenye nzi. Kwa sababu fiche fiche pekee ndiyo iliyohifadhiwa, DeepSeek-V2 iliripoti kukata kumbukumbu ya kache ya KV kwa zaidi ya 90% dhidi ya uzingatiaji wa kawaida wa vichwa vingi, kuwezesha miktadha mirefu na saizi kubwa za bechi. Muhimu sana, matrices ya makadirio ya juu yanaweza kukunjwa katika uzani mwingine, kwa hivyo MLA hufanikisha mbano huu kwa hasara kidogo au bila kupimika katika ubora wa uundaji.
Ufahamu wa Kiufundi
MLA hufanya ukandamizaji wa viungo vya kiwango cha chini: hali iliyofichwa ya kila ishara inakadiriwa hadi vekta ndogo iliyofichika, na matiti tofauti ya makadirio yanaunda upya funguo na maadili kwa kila kichwa. Ujanja wa busara ni 'kunyonya' uzani wa makadirio ya juu katika makadirio ya hoja na matokeo, kwa hivyo muundo hauwahi kuwa funguo/maadili kamili wakati wa makisio. Upachikaji wa nafasi za mzunguko hushughulikiwa kwa njia ya ufunguo iliyotenganishwa, kwa kuwa mzunguko hauwezi kufyonzwa kwa njia sawa, kuhifadhi maelezo ya nafasi.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Uangalifu wa Vichwa Vingi
MLA alisaidia kufanya DeepSeek-V2 na V3 kuwa ya kiuchumi kutumika kwa kiwango kikubwa, na mbinu hiyo inaenea huku timu zikifuatilia uelekezaji wa muktadha wa bei nafuu wa muda mrefu. Tarajia mbano fiche ya mtindo wa MLA ili kuchanganyika na tabaka chache za Mchanganyiko-wa-Wataalamu, akiba zilizopunguzwa, na usimbaji wa kubahatisha katika miundo wazi ya siku zijazo. Watafiti pia wanachunguza urefu uliofichika unaweza kupungua kwa umbali gani kabla ya ubora kushuka, na kama wazo lile lile la kiwango cha chini linaweza kubana usikivu wakati wa mafunzo, sio tu makisio.
Utekelezaji wa Ulimwengu Halisi
Kutumikia miundo ya gumzo ya DeepSeek-V2/V3 yenye alama ndogo sana za kumbukumbu za GPU kwa kila ombi.
Kuendesha swali la hati ndefu kujibu ambapo kashe kubwa ya KV ingemaliza VRAM
Kuongeza ukubwa wa bechi ya makisio kwenye GPU isiyobadilika kwa sababu kila mfuatano huhifadhi vekta ndogo iliyofichika pekee
Kuwasha madirisha marefu ya muktadha kwenye maunzi ya bidhaa kwa wasaidizi walioboreshwa
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Umakini wa Maswali mengi
Maswali yanayoulizwa mara kwa mara
Umakini wa Vichwa Vingi ni Nini?
Multi-Head Latent Attention (MLA) ni utaratibu wa usikivu, ulioletwa katika DeepSeek-V2, ambao unabana akiba ya ufunguo wenye njaa ya kumbukumbu kuwa vekta ndogo iliyofichika iliyoshirikiwa. Huruhusu miundo mikubwa ya lugha kuendesha na kumbukumbu ndogo zaidi ya GPU huku ikiweka ubora karibu na umakini wa kawaida.
Je, ni tatizo gani msingi Umakini wa Vichwa Vingi umeundwa kupunguza?
MLA inalenga akiba ya KV, ambayo hukua kwa urefu wa muktadha na kutawala kumbukumbu wakati wa kuunda maandishi.
Je, MLA inapunguzaje akiba ya KV?
MLA huhifadhi vekta moja fiche fiche kwa kila tokeni na huunda upya funguo na thamani kutoka kwayo kupitia makadirio ya juu.
Ni modeli gani ilianzisha Umakini wa Vichwa Vingi kwa mara ya kwanza?
MLA ilianzishwa na DeepSeek katika muundo wake wa DeepSeek-V2 na kupelekwa kwenye DeepSeek-V3.
Kwa nini MLA anahitaji njia tofauti 'iliyotenganishwa' kwa upachikaji wa nafasi za mzunguko?
Ubadilishaji wa mzunguko hauwezi kufyonzwa kwenye vipimo vingine vya uzito, kwa hivyo MLA huweka kijenzi kidogo cha ufunguo kilichotenganishwa ili kubeba taarifa fupi.
Takriban ni kiasi gani cha upunguzaji wa kumbukumbu ya KV-cache ambayo DeepSeek-V2 iliripoti kutoka kwa MLA dhidi ya umakini wa kawaida wa vichwa vingi?
DeepSeek-V2 iliripoti kukata kumbukumbu ya kache ya KV kwa zaidi ya 90%, kuwezesha miktadha mirefu na bechi kubwa zaidi.