Kuunganisha Kuendelea
Kukusanya mfululizo ni mbinu ya kuhudumia ambayo huongeza na kuondoa maombi kutoka kwa tokeni ya bechi inayoendesha, badala ya kungoja bechi nzima ikamilike.
Muhtasari
It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.
Dive ya kina
GPU zina kasi zaidi zinapochakata maombi mengi pamoja katika kundi. Mtazamo wa kutojua, upangaji tuli, huweka pamoja seti isiyobadilika ya maombi, huyaendesha yote hadi kukamilika, kisha huanza kundi linalofuata. Shida: matokeo ya muundo wa lugha hutofautiana kwa urefu, kwa hivyo maombi mafupi humaliza mapema na nafasi zao hukaa bila kufanya kitu huku kundi likisubiri ile ndefu zaidi, kupoteza mizunguko ya GPU na kuchelewesha wanaowasili. Kukusanya mfululizo (pia huitwa batching ya ndani ya ndege au kiwango cha kurudia, kinachojulikana na karatasi ya Orca na kutumika katika vLLM, TensorRT-LLM, na TGI) hufanya kazi kwa uzito wa hatua moja ya kusimbua. Baada ya kila ishara kuzalishwa, mfuatano uliokamilika hutoka kwenye kundi na maombi mapya huingizwa mara moja. Hii huweka bechi kamili na GPU iliyojaa, mara nyingi huongeza uboreshaji mara kadhaa na muda wa chini wa kusubiri kwa watumiaji wanaosubiri.
Ufahamu wa Kiufundi
Mabadiliko muhimu ni kutoka kwa kubatilisha maombi mazima hadi kuweka marudio ya mtu binafsi. Katika kila hatua ya kusimbua kipanga ratiba huunda seti amilifu: huendesha pasi moja ya mbele juu ya mfuatano wote wa ndani ya ndege, hutoa toni moja kila moja, huondoa yoyote inayofikia kikomo cha mwisho cha mfuatano au kikomo cha urefu, na hukubali maombi yaliyowekwa kwenye foleni ya kujaza nafasi zilizoachiliwa. Kuoanisha hii na kumbukumbu ya KV inayoweza kunyumbulika ya PagedAttention hurahisisha uwekaji na uondoaji wa mfuatano katikati ya safari ya ndege, kwa kuwa kashe ya kila msururu huishi katika vizuizi huru.
Athari za kimkakati
Cost and budget
Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.
Maamuzi ya wazi zaidi
Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.
Quality control
Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.
Mustakabali wa Kuunganisha Kuendelea
Ukusanyaji unaoendelea sasa ni wa kawaida katika utoaji wa LLM wa uzalishaji. Kazi ya siku zijazo huboresha kipanga ratiba: kutenganisha awamu ya kujaza msimbo mzito kutoka kwa awamu nyepesi ya kusimbua (utenganishaji), ujazo awali uliogawanywa ili kuzuia kukwama kwa usimbaji, sera za kipaumbele na usawa kwa mzigo mseto wa kazi, na uunganishaji mkali zaidi na usimbaji wa kubahatisha ili tokeni nyingi za rasimu zithibitishwe kwa kila hatua. Lengo ni kubana tokeni za juu zaidi kwa kila sekunde kwa kila GPU huku ukiweka muda wa kusubiri wa majibu ya mtu binafsi kuwa wa chini na unaoweza kutabirika.
Utekelezaji wa Ulimwengu Halisi
API ya gumzo inayokubali ujumbe mpya wa mtumiaji kwenye kundi linaloendelea mara moja badala ya kuwaweka kwenye foleni kwa kundi linalofuata.
Kuondoa jibu fupi lililokamilishwa katikati ya kundi na kujaza nafasi yake ili GPU isifanye kazi kusubiri kwa kizazi kirefu.
Kuchanganya utengamano unaoendelea na PagedAttention ya vLLM ili kuingiza na kuondoa mlolongo kwa bei nafuu katika kila hatua ya kusimbua.
Huduma ya kukamilisha msimbo inayodumisha tokeni za juu kwa sekunde chini ya msongamano wa trafiki wa urefu tofauti kwa kuweka bechi kamili.
Hatari & Walinzi
Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.
Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.
Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.
Ramani ya Utekelezaji
Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.
Benchmark chini ya mzigo halisi na hali ya data.
Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.
Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Continuous Batching quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kubernetes kwa Mizigo ya Kazi ya ML
Maswali yanayoulizwa mara kwa mara
What is Continuous Batching?
Kukusanya mfululizo ni mbinu ya kuhudumia ambayo huongeza na kuondoa maombi kutoka kwa tokeni ya bechi inayoendesha, badala ya kungoja bechi nzima ikamilike. Huweka GPU ikiwa na shughuli nyingi na huongeza kwa kasi idadi ya watumiaji ambao muundo wa AI unaweza kutumika mara moja.
Je! ni udhaifu gani mkuu wa batching tuli (iliyowekwa) kwa huduma ya LLM?
Kwa sababu urefu wa matokeo hutofautiana, mifuatano iliyokamilishwa hukaa bila kufanya kitu hadi ile ya polepole ikamilike, ikipoteza mizunguko ya GPU na kuchelewesha maombi mapya.
Je, ni kwa uzito gani kuendelea kubandika huongeza na kuondoa maombi?
Ukusanyaji unaoendelea (wa kiwango cha kurudia) husasisha seti inayotumika baada ya kila hatua ya kusimbua, kwa hivyo hufanya kazi tokeni kwa ishara badala ya kwa ombi zima.
Wakati mlolongo unakamilika katikati ya bechi chini ya upangaji unaoendelea, nini hufanyika kwa nafasi yake?
Msururu uliokamilishwa huondolewa na maombi ya kusubiri yanawekwa ndani mara moja, na kufanya kundi likiwa limejaa na GPU ina shughuli nyingi.
Je, ni mbinu gani huoanishwa kwa njia ya kawaida na upangaji unaoendelea ili kufanya uwekaji/uondoaji wa mlolongo kuwa nafuu?
PagedAttention huhifadhi akiba ya KV ya kila mfuatano katika vizuizi huru, kwa hivyo kuongeza au kuondoa mfuatano katikati ya safari ya ndege hakusumbui kumbukumbu za wengine.
Ni karatasi gani ya utafiti ambayo kwa kawaida hupewa sifa ya kueneza upangaji wa kiwango cha kurudia (kuendelea)?
Karatasi ya Orca ilianzisha upangaji wa kiwango cha iteration, na wazo lilipitishwa kwa kuhudumia mifumo kama vLLM, TGI, na TensorRT-LLM.