MWONGOZO wa Kiufundi

Kuunganisha Kuendelea

Kukusanya mfululizo ni mbinu ya kuhudumia ambayo huongeza na kuondoa maombi kutoka kwa tokeni ya bechi inayoendesha, badala ya kungoja bechi nzima ikamilike.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.

Dive ya kina

GPU zina kasi zaidi zinapochakata maombi mengi pamoja katika kundi. Mtazamo wa kutojua, upangaji tuli, huweka pamoja seti isiyobadilika ya maombi, huyaendesha yote hadi kukamilika, kisha huanza kundi linalofuata. Shida: matokeo ya muundo wa lugha hutofautiana kwa urefu, kwa hivyo maombi mafupi humaliza mapema na nafasi zao hukaa bila kufanya kitu huku kundi likisubiri ile ndefu zaidi, kupoteza mizunguko ya GPU na kuchelewesha wanaowasili. Kukusanya mfululizo (pia huitwa batching ya ndani ya ndege au kiwango cha kurudia, kinachojulikana na karatasi ya Orca na kutumika katika vLLM, TensorRT-LLM, na TGI) hufanya kazi kwa uzito wa hatua moja ya kusimbua. Baada ya kila ishara kuzalishwa, mfuatano uliokamilika hutoka kwenye kundi na maombi mapya huingizwa mara moja. Hii huweka bechi kamili na GPU iliyojaa, mara nyingi huongeza uboreshaji mara kadhaa na muda wa chini wa kusubiri kwa watumiaji wanaosubiri.

Ufahamu wa Kiufundi

Mabadiliko muhimu ni kutoka kwa kubatilisha maombi mazima hadi kuweka marudio ya mtu binafsi. Katika kila hatua ya kusimbua kipanga ratiba huunda seti amilifu: huendesha pasi moja ya mbele juu ya mfuatano wote wa ndani ya ndege, hutoa toni moja kila moja, huondoa yoyote inayofikia kikomo cha mwisho cha mfuatano au kikomo cha urefu, na hukubali maombi yaliyowekwa kwenye foleni ya kujaza nafasi zilizoachiliwa. Kuoanisha hii na kumbukumbu ya KV inayoweza kunyumbulika ya PagedAttention hurahisisha uwekaji na uondoaji wa mfuatano katikati ya safari ya ndege, kwa kuwa kashe ya kila msururu huishi katika vizuizi huru.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa Kuunganisha Kuendelea

Ukusanyaji unaoendelea sasa ni wa kawaida katika utoaji wa LLM wa uzalishaji. Kazi ya siku zijazo huboresha kipanga ratiba: kutenganisha awamu ya kujaza msimbo mzito kutoka kwa awamu nyepesi ya kusimbua (utenganishaji), ujazo awali uliogawanywa ili kuzuia kukwama kwa usimbaji, sera za kipaumbele na usawa kwa mzigo mseto wa kazi, na uunganishaji mkali zaidi na usimbaji wa kubahatisha ili tokeni nyingi za rasimu zithibitishwe kwa kila hatua. Lengo ni kubana tokeni za juu zaidi kwa kila sekunde kwa kila GPU huku ukiweka muda wa kusubiri wa majibu ya mtu binafsi kuwa wa chini na unaoweza kutabirika.

Utekelezaji wa Ulimwengu Halisi

API ya gumzo inayokubali ujumbe mpya wa mtumiaji kwenye kundi linaloendelea mara moja badala ya kuwaweka kwenye foleni kwa kundi linalofuata.

Kuondoa jibu fupi lililokamilishwa katikati ya kundi na kujaza nafasi yake ili GPU isifanye kazi kusubiri kwa kizazi kirefu.

Kuchanganya utengamano unaoendelea na PagedAttention ya vLLM ili kuingiza na kuondoa mlolongo kwa bei nafuu katika kila hatua ya kusimbua.

Huduma ya kukamilisha msimbo inayodumisha tokeni za juu kwa sekunde chini ya msongamano wa trafiki wa urefu tofauti kwa kuweka bechi kamili.

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Continuous Batching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Kubernetes kwa Mizigo ya Kazi ya ML

Maswali yanayoulizwa mara kwa mara

What is Continuous Batching?

Kukusanya mfululizo ni mbinu ya kuhudumia ambayo huongeza na kuondoa maombi kutoka kwa tokeni ya bechi inayoendesha, badala ya kungoja bechi nzima ikamilike. Huweka GPU ikiwa na shughuli nyingi na huongeza kwa kasi idadi ya watumiaji ambao muundo wa AI unaweza kutumika mara moja.

Je! ni udhaifu gani mkuu wa batching tuli (iliyowekwa) kwa huduma ya LLM?

Kwa sababu urefu wa matokeo hutofautiana, mifuatano iliyokamilishwa hukaa bila kufanya kitu hadi ile ya polepole ikamilike, ikipoteza mizunguko ya GPU na kuchelewesha maombi mapya.

Je, ni kwa uzito gani kuendelea kubandika huongeza na kuondoa maombi?

Ukusanyaji unaoendelea (wa kiwango cha kurudia) husasisha seti inayotumika baada ya kila hatua ya kusimbua, kwa hivyo hufanya kazi tokeni kwa ishara badala ya kwa ombi zima.

Wakati mlolongo unakamilika katikati ya bechi chini ya upangaji unaoendelea, nini hufanyika kwa nafasi yake?

Msururu uliokamilishwa huondolewa na maombi ya kusubiri yanawekwa ndani mara moja, na kufanya kundi likiwa limejaa na GPU ina shughuli nyingi.

Je, ni mbinu gani huoanishwa kwa njia ya kawaida na upangaji unaoendelea ili kufanya uwekaji/uondoaji wa mlolongo kuwa nafuu?

PagedAttention huhifadhi akiba ya KV ya kila mfuatano katika vizuizi huru, kwa hivyo kuongeza au kuondoa mfuatano katikati ya safari ya ndege hakusumbui kumbukumbu za wengine.

Ni karatasi gani ya utafiti ambayo kwa kawaida hupewa sifa ya kueneza upangaji wa kiwango cha kurudia (kuendelea)?

Karatasi ya Orca ilianzisha upangaji wa kiwango cha iteration, na wazo lilipitishwa kwa kuhudumia mifumo kama vLLM, TGI, na TensorRT-LLM.