Tesiwaju Batching
Ilọsiwaju batching jẹ ilana iṣẹ ṣiṣe ti o ṣafikun ati yọ awọn ibeere kuro lati ami-ami ipele ti nṣiṣẹ, dipo iduro fun gbogbo ipele ti o wa titi lati pari.
Akopọ
It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.
Jin Dive
Awọn GPU yara yara nigbati wọn ṣe ilana ọpọlọpọ awọn ibeere papọ ni ipele kan. Ọna ti o rọrun, batching aimi, awọn akojọpọ awọn ibeere ti o wa titi, ṣiṣe gbogbo wọn lati pari, lẹhinna bẹrẹ ipele atẹle. Iṣoro naa: awọn abajade awoṣe ede yatọ pupọ ni gigun, nitorinaa awọn ibeere kukuru pari ni kutukutu ati awọn iho wọn joko laišišẹ lakoko ti ipele naa nduro fun eyi ti o gunjulo, jafara awọn iyipo GPU ati idaduro awọn dide titun. Batching titesiwaju (ti a tun pe ni ọkọ ofurufu tabi ipele ipele aṣetunṣe, ti o gbajumọ nipasẹ iwe Orca ati lilo ninu vLLM, TensorRT-LLM, ati TGI) n ṣiṣẹ ni granularity ti igbesẹ iyipada kan. Lẹhin ti aami kọọkan ti ṣe ipilẹṣẹ, awọn ilana ti o pari jade kuro ni ipele ati awọn ibeere ti o ṣẹṣẹ de ti wa ni iho lẹsẹkẹsẹ. Eyi jẹ ki ipele naa kun ati pe GPU ti kun, nigbagbogbo n ṣe igbega iṣelọpọ ni ọpọlọpọ igba pẹlu airi kekere fun awọn olumulo nduro.
Imọ-imọ-ẹrọ
Iyipada bọtini jẹ lati pipọ gbogbo awọn ibeere si pipọ awọn aṣetunṣe kọọkan. Ni gbogbo igbesẹ ipinnu, oluṣeto kọ eto ti nṣiṣe lọwọ: o nṣiṣẹ siwaju kọja lori gbogbo awọn ọna ti o wa ninu ọkọ ofurufu, gbe ami kan jade ni ọkọọkan, yọkuro eyikeyi ti o lu ami-ipari-ipari tabi opin ipari, ati gba awọn ibeere isinku lati kun awọn iho ominira. Papọ eyi pẹlu PagedAttention's rọ KV iranti jẹ ki fifi sii ati yiyọ awọn ilana larin ọkọ ofurufu jẹ olowo poku, niwọn igba ti kaṣe ọkọọkan n gbe ni awọn bulọọki ominira.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Lemọlemọfún Batching
Batching lemọlemọfún ni bayi boṣewa ni iṣelọpọ LLM sìn. Iṣẹ iwaju ṣe atunṣe oluṣeto iṣeto: yiya sọtọ ipele iṣaju iṣiro-eru lati ipele ipinnu fẹẹrẹ fẹẹrẹ (ipinnu), prefill chunked lati yago fun yiyan didimu, pataki ati awọn eto imulo ododo fun awọn ẹru iṣẹ ti o dapọ, ati isọpọ pọpọ pẹlu asọye asọye nitoribẹẹ awọn ami ami ikọsilẹ lọpọlọpọ jẹ ifọwọsi ni igbesẹ kan. Ibi-afẹde naa ni fifun awọn ami-ami ti o pọju-fun-keji fun GPU lakoko ti o jẹ ki airotẹlẹ idahun ẹni kọọkan jẹ kekere ati asọtẹlẹ.
Real-World imuse
API iwiregbe n gba awọn ifiranṣẹ olumulo ti o ṣẹṣẹ de sinu ipele ti nṣiṣẹ lẹsẹkẹsẹ dipo ti wọn laini fun ipele atẹle
Yiyọ idahun kukuru ti o pari ni aarin-ipele ati ẹhin iho rẹ ki GPU ko ṣe alailẹṣẹ duro lori iran pipẹ
Apapọ batching lemọlemọfún pẹlu vLLM's Paged Ifarabalẹ lati fi sii ati yọkuro awọn ilana laini ni ipele kọọkan
Iṣẹ ipari koodu kan ti n ṣetọju awọn ami giga-fun-keji labẹ bursty, ijabọ gigun-iyipada nipa titọju ipele ni kikun
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Continuous Batching quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Kubernetes fun ML Workloads
Awọn ibeere ti a beere nigbagbogbo
What is Continuous Batching?
Ilọsiwaju batching jẹ ilana iṣẹ ṣiṣe ti o ṣafikun ati yọ awọn ibeere kuro lati ami-ami ipele ti nṣiṣẹ, dipo iduro fun gbogbo ipele ti o wa titi lati pari. O jẹ ki GPU n ṣiṣẹ nigbagbogbo ati pe o pọ si iye awọn olumulo ti awoṣe AI le ṣiṣẹ ni ẹẹkan.
Kini ailera akọkọ ti batching aimi (ti o wa titi) fun iṣẹ LLM?
Nitori awọn ipari ti o wu jade yatọ, awọn ilana ti pari joko laišišẹ titi ti ọkan ti o lọra yoo fi pari, jafara awọn iyipo GPU ati idaduro awọn ibeere titun.
Ni granularity wo ni batching lemọlemọfún ṣafikun ati yọ awọn ibeere kuro?
Ilọsiwaju (ipele aṣetunṣe) ṣe imudojuiwọn eto ti nṣiṣe lọwọ lẹhin gbogbo igbesẹ iyipada ẹyọkan, nitorinaa o nṣiṣẹ ami-ami-ami dipo fun gbogbo ibeere.
Nigba ti a ọkọọkan pari aarin-ipele labẹ lemọlemọfún batching, ohun ti o ṣẹlẹ si awọn oniwe- Iho ?
Awọn ilana ti o pari ti jade ati awọn ibeere idaduro ti wa ni iho lẹsẹkẹsẹ, ti o jẹ ki ipele naa kun ati GPU nšišẹ.
Ilana wo ni o so pọ nipa ti ara pẹlu batching lemọlemọfún lati jẹ ki fifi sii / yiyọ awọn ilana jẹ olowo poku?
Paged Ifarabalẹ tọju kaṣe KV ọkọọkan kọọkan ni awọn bulọọki ominira, nitorinaa fifikun tabi yiyọ ọkọọkan kan kuro ni aarin-ofurufu ko ni idamu iranti awọn miiran.
Iwe iwadi wo ni o jẹ olokiki pẹlu ipele aṣetunṣe olokiki (tẹsiwaju) batching?
Iwe Orca naa ṣafihan iṣeto-ipele aṣetunṣe, ati pe imọran ti gba nipasẹ awọn eto ṣiṣe bi vLLM, TGI, ati TensorRT-LLM.