Ujazaji Mapema Uliogawanywa na Utoaji wa Misimbo
Usanifu unaotumika ambao hugawanya uelekezaji wa modeli kubwa ya lugha katika awamu mbili tofauti—kujaza mapema na kusimbua—na kuziendesha kwenye vidimbwi tofauti vya GPU.
Muhtasari
It matters because these two phases have opposite hardware appetites, and forcing them onto the same machines wastes capacity and hurts latency.
Dive ya kina
Wakati LLM inajibu, inafanya kazi katika hatua mbili. Jaza awali husoma kidokezo kizima mara moja na hutengeneza akiba ya thamani ya ufunguo (KV); huu ni mlipuko mkubwa, sambamba, unaofungamana na hesabu ambao hujaa vitengo vya hesabu vya GPU. Simbua kisha hutengeneza tokeni moja baada ya nyingine, kila hatua ikisoma kashe nzima ya KV-kipimo cha kumbukumbu-kipimo data, cha kukokotoa kidogo. Endesha pamoja, kujaza kwa muda mrefu kunasimamisha msimbo wa kila mtu (uzuiaji wa mstari), na kuunganisha hizi mbili kunaleta usumbufu. Utenganishaji huweka ujazo wa awali kwenye dimbwi moja la GPU na kusimbua lingine, na kuhamisha akiba ya KV kati yao kupitia miunganisho ya haraka kama vile NVLink au InfiniBand. Kila bwawa hupangwa na kupimwa kivyake, kuboresha ubora, kulainisha muda wa kusubiri, na kuwaruhusu waendeshaji kugusa shabaha za tokeni za muda-hadi-kwanza na saa-kwa-tokeni kwa wakati mmoja.
Ufahamu wa Kiufundi
Awamu hizi mbili zinatofautiana katika ugumu wao. Kujaza mapema huchakata tokeni zote za papo hapo kwa sawia, kwa hivyo FLOPs zake hupimwa kwa urefu wa haraka na huongeza alama za tensor. Kusimbua ni kiotomatiki: kila tokeni mpya inahitaji pasi moja ya mbele ambayo inasoma tena akiba kamili ya KV kutoka HBM, kwa hivyo upitishaji huwekwa lango na kipimo data cha kumbukumbu, si kukokotoa. Utenganishaji hutumia hili vyema kwa kuweka ukubwa, kundi, na hata kuchagua ulinganifu tofauti kwa kila bwawa, kisha kusafirisha akiba ya KV kutoka kwa wafanyikazi wa kujaza mapema ili kusimbua wafanyikazi.
Athari za kimkakati
Cost and budget
Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.
Maamuzi ya wazi zaidi
Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.
Quality control
Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.
Mustakabali wa Ujazaji Mapema Uliogawanyika na Utoaji Msimbo
Tarajia utenganishaji uwe chaguomsingi katika rafu za uzalishaji. Mifumo kama vile DistServe, Splitwise, na Mooncake iliitangaza, na vLLM na NVIDIA Dynamo sasa husafirisha hali zilizogawanywa. Utafiti unasukuma uboreshaji wa uhamishaji wa akiba ya KV, kukusanya akiba na kutumia tena katika maombi yote, kusawazisha upya kwa uwiano wa ujazo awali/kusimbua chini ya mabadiliko ya trafiki, na muunganisho mkali zaidi na uakibishaji wa kiambishi awali na ujazo wa awali uliokatwa. Madirisha ya muktadha yanapokua na kuwa mamilioni ya tokeni, kutenganisha awamu hizi kunazidi kuwa muhimu kwa huduma ya gharama nafuu na ya muda wa chini.
Utekelezaji wa Ulimwengu Halisi
Mratibu wa gumzo huelekeza hati ndefu kwa mkusanyiko wa ujazo wa awali wa hesabu nzito, kisha mitiririko ya majibu kutoka kwa kikundi cha kusimbua kilichoboreshwa kwa kumbukumbu ili kuweka muda wa kusubiri kwa urahisi.
NVIDIA Dynamo na vLLM huruhusu waendeshaji kupeleka vikundi tofauti vya kujaza mapema na kusimbua vikundi vya wafanyikazi ili mlipuko wa vidokezo virefu usifanye vizazi vinavyoendelea.
Mooncake (inayotumiwa na Kimi ya Moonshot AI) hutenganisha ujazo wa awali na kusimbua na kuongeza hifadhi ya akiba ya KV iliyosambazwa ili kupunguza urejeshaji wa haraka usiohitajika kwa kiwango.
Huduma ya kukamilisha msimbo huweka wakfu hifadhi ndogo ya kujaza mapema kwa vidokezo vifupi na dimbwi kubwa la kusimbua, kwa kuwa gharama nyingi hutokana na kutiririsha tokeni nyingi za matokeo.
Hatari & Walinzi
Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.
Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.
Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.
Ramani ya Utekelezaji
Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.
Benchmark chini ya mzigo halisi na hali ya data.
Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.
Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Disaggregated Prefill and Decode Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
KServe na Model Serving kwenye Kubernetes
Maswali yanayoulizwa mara kwa mara
What is Disaggregated Prefill and Decode Serving?
Usanifu unaotumika ambao hugawanya uelekezaji wa modeli kubwa ya lugha katika awamu mbili tofauti—kujaza mapema na kusimbua—na kuziendesha kwenye vidimbwi tofauti vya GPU. Ni muhimu kwa sababu awamu hizi mbili zina hamu ya vifaa kinyume, na kuzilazimisha kwenye mashine sawa hupoteza uwezo na kuumiza muda wa kusubiri.
Ni nini sababu kuu ya maunzi ya kutenganisha kujaza mapema na kusimbua kwenye madimbwi tofauti ya GPU?
Kujaza mapema huchakata dodoso zima sambamba na kueneza hesabu, huku kusimbua kunasoma akiba ya KV kila hatua na kuzuiliwa na kipimo data cha kumbukumbu—tamaa zinazopingana zinazohalalisha dimbwi tofauti, zilizopangwa kwa kujitegemea.
Ni muundo gani wa data lazima uhamishwe kutoka kwa wafanyikazi wa kujaza mapema ili kusimbua wafanyikazi?
Kujaza mapema hutengeneza kashe ya KV kwa arifa; kusimbua kunahitaji kache hiyo kuendelea kutoa, kwa hivyo kache hiyo inasafirishwa kwa muunganisho wa haraka hadi kwenye dimbwi la kusimbua.
Ni shida gani ambayo utenganishaji hupunguza haswa katika usanidi wa pamoja wa GPU?
Kwenye GPU zilizoshirikiwa, mlipuko mrefu wa kujaza mapema unaweza kuzuia hatua zinazoendelea za kusimbua; kuwatenganisha huzuia kuingiliwa huko na kuleta utulivu wa mkia.
Kwa nini kujaza mapema kunaweza kupangwa kwa fujo lakini kubaini faida kutoka kwa urekebishaji tofauti?
Jaza mapema tokeni zote za papo hapo kwa pamoja, kwa hivyo beti kubwa hulisha chembe za tensor vizuri; decode hutoa toni moja kwa wakati mmoja na inafungwa na kumbukumbu, kwa hivyo inakua tofauti.
Ni viunganishi vipi kwa kawaida hutumika kuhamisha kashe ya KV kati ya madimbwi yaliyogawanywa?
Viungo vya kipimo data cha juu, vya kusubiri muda wa chini kama NVLink (intra-node) na InfiniBand (inter-nodi) vinahitajika ili uhamishaji wa akiba ya KV usiwe kikwazo kipya.