Ipilẹ ti a ti pinya ati Di koodu Ṣiṣe
Itumọ iṣẹ ṣiṣe ti o pin ifọrọwewe awoṣe ede nla si awọn ipele lọtọ meji-ṣaaju ati pinnu — ati ṣiṣe wọn lori awọn adagun-omi oriṣiriṣi ti GPUs.
Akopọ
O ṣe pataki nitori awọn ipele meji wọnyi ni awọn ifẹkufẹ hardware idakeji, ati fifi agbara mu wọn lori awọn ẹrọ kanna n ṣofintoto agbara ati ṣe ipalara latency.
Jin Dive
Nigbati LLM ba dahun, o ṣiṣẹ ni awọn ipele meji. Prefill ka gbogbo kiakia ni ẹẹkan ati kọ kaṣe bọtini iye-iye (KV); eyi jẹ nla kan, ti o jọra, ti nwaye-iṣiro ti o fi kun awọn ẹya math GPU. Yiyipada koodu lẹhinna ṣe agbekalẹ awọn ami ami kan ni akoko kan, igbesẹ kọọkan ni kika gbogbo kaṣe KV — iranti-bandwidth ti o so mọ, ẹtan-iṣiro-diẹ. Ṣiṣe papọ, iṣaju gigun kan duro de koodu gbogbo eniyan (idena ori-ila), ati batching awọn mejeeji ṣẹda kikọlu. Iyapa nfi iṣaju sori adagun GPU kan ati pinnu lori omiiran, gbigbe kaṣe KV laarin wọn lori awọn asopọ iyara bi NVLink tabi InfiniBand. Adagun adagun kọọkan ti wa ni aifwy ati iwọn ni ominira, imudara goodput, didin lairi iru, ati jẹ ki awọn oniṣẹ kọlu akoko-si-aami-akọkọ ati awọn ibi-afẹde ami-akoko-fun-jade-tokini ni nigbakannaa.
Imọ-imọ-ẹrọ
Awọn ipele meji yatọ ni igo wọn. Ṣaju awọn ilana gbogbo awọn ami itọka ni afiwe, nitorinaa iwọn FLOPs rẹ pẹlu gigun kiakia ati pe o ga julọ awọn ohun kohun tensor. Iyipada koodu jẹ autoregressive: ami tuntun kọọkan nilo iwe-iwọle siwaju kan ti o tun ka kaṣe KV ni kikun lati HBM, nitorinaa gbigbejade jẹ gated nipasẹ bandiwidi iranti, kii ṣe iṣiro. Iyatọ n lo eyi nipasẹ iwọn, batching, ati paapaa yiyan isọdọmọ oriṣiriṣi fun adagun-odo kọọkan, lẹhinna gbigbe kaṣe KV lati ọdọ awọn oṣiṣẹ iṣaaju lati pinnu awọn oṣiṣẹ.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ọjọ iwaju ti Iṣaaju Pipapọ ati Yii Sisin Di koodu
Reti iyapa lati di aiyipada ni awọn akopọ iṣelọpọ. Awọn ọna ṣiṣe bii DistServe, Splitwise, ati Mooncake jẹ olokiki rẹ, ati vLLM ati NVIDIA Dynamo ni bayi gbe awọn ipo ipinya. Iwadi n titari awọn iṣapeye gbigbe kaṣe KV-cache, iṣakojọpọ kaṣe ati ilotunlo kọja awọn ibeere, iwọntunwọnsi atunlo ti iṣaju/awọn ipin ipin labẹ gbigbe gbigbe, ati isọpọ titọ pẹlu caching ìpele ati ami-iṣaaju chunked. Bi awọn ferese ọrọ ti n dagba si awọn miliọnu awọn ami ami, yiya sọtọ awọn ipele wọnyi di pataki pupọ si fun iye owo-doko, iṣẹ ṣiṣe lairi kekere.
Real-World imuse
Oluranlọwọ iwiregbe n ṣe awọn ọna iwe gigun ti o tọ si iṣupọ-iṣapejuwe ti o wuwo, lẹhinna awọn ṣiṣan ṣiṣan lati inu iṣupọ ipinnu ipinnu iranti ti iṣapeye lati jẹ ki titẹ titẹ laipẹ jẹ.
NVIDIA Dynamo ati vLLM jẹ ki awọn oniṣẹ ran awọn ami-iṣaaju ọtọtọ lọ ki o si pinnu awọn ẹgbẹ oṣiṣẹ nitori ti nwaye ti awọn iyara gigun ko di awọn iran ti nlọ lọwọ.
Mooncake (ti Moonshot AI's Kimi ti lo) ṣe iyasọtọ iṣaju ati pinnu ati ṣafikun adagun kaṣe KV ti a pin kaakiri lati ge atunwi iyara laiṣe ni iwọn.
Iṣẹ ipari koodu kan ṣe iyasọtọ adagun-pipe kekere kan fun awọn itusilẹ kukuru ati adagun-ipinnu nla kan, nitori idiyele pupọ julọ wa lati ṣiṣanwọle ọpọlọpọ awọn ami itẹjade.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Disaggregated Prefill and Decode Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
KServe ati Awoṣe Nṣiṣẹ lori Kubernetes
Awọn ibeere ti a beere nigbagbogbo
Kini Disaggregated Prefill ati Decode Serving?
Itumọ iṣẹ ṣiṣe ti o pin ifọrọwewe awoṣe ede nla si awọn ipele lọtọ meji-ṣaaju ati pinnu — ati ṣiṣe wọn lori awọn adagun-omi oriṣiriṣi ti GPUs. O ṣe pataki nitori awọn ipele meji wọnyi ni awọn ohun elo ohun elo idakeji, ati fipa mu wọn sori awọn ẹrọ kanna n sọ agbara nu ati ṣe ipalara lairi.
Kini idi ohun elo mojuto fun yiyatọ iṣaju ati pinnu lori awọn adagun-odo GPU oriṣiriṣi?
Ṣaṣaaju awọn ilana gbogbo itọsi ni afiwe ati awọn iṣiro saturates, lakoko ti o ba pinnu lati ka kaṣe KV ni igbesẹ kọọkan ati pe o ni opin nipasẹ bandiwidi iranti — awọn itunra idakeji ti o ṣe idalare lọtọ, awọn adagun aifwy ominira.
Eto data wo ni o gbọdọ gbe lati ọdọ awọn oṣiṣẹ iṣaju lati pinnu awọn oṣiṣẹ?
Prefill kọ kaṣe KV fun tọ; yan koodu nilo kaṣe yẹn lati tẹsiwaju ti ipilẹṣẹ, nitorinaa a ti fi kaṣe naa ranṣẹ lori ibaraenisepo iyara si adagun-pipe koodu.
Iṣoro wo ni iyapa ni pataki dinku ni iṣeto-GPU pinpin?
Lori awọn GPUs ti o pin, ti nwaye iṣaju gigun gun le dènà awọn igbesẹ iyipada ti nlọ lọwọ; yiya sọtọ wọn ṣe idilọwọ kikọlu yẹn ati pe o duro lairi iru.
Kini idi ti iṣaju iṣaju le jẹ ti iwọn ni ibinu ṣugbọn pinnu awọn anfani lati yiyi oriṣiriṣi?
Ṣaju awọn ilana gbogbo awọn ami ami kiakia, nitorinaa awọn ipele nla jẹ ifunni awọn ohun kohun tensor daradara; decode n ṣe ami ami kan ni akoko kan ati pe o jẹ ẹnu nipasẹ iranti, nitorinaa o ṣe iwọn oriṣiriṣi.
Awọn ọna asopọpọ wo ni a maa n lo lati gbe kaṣe KV laarin awọn adagun ti a pin?
Bandiwidi giga-giga, awọn ọna asopọ lairi kekere bi NVLink (intra-node) ati InfiniBand (inter-node) ni a nilo ki gbigbe KV-cache ko di igo tuntun.