Iparapọ Amoye fun MoE Sìn
Ijuwe ti iwé yapa awoṣe Adapọ-ti-Awọn amoye ni ọpọlọpọ kikọ sii-siwaju 'awọn amoye' kọja awọn GPU oriṣiriṣi nitorina ẹrọ kọọkan di bibẹ pẹlẹbẹ ti awọn paramita nikan.
Akopọ
It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.
Jin Dive
Apapọ-ti-Amoye (MoE) Layer rọpo ọkan nla kikọ sii-siwaju nẹtiwọki pẹlu ọpọlọpọ awọn kere (awọn amoye) pẹlu olulana ti o gbe oke-k (igba 1 tabi 2) amoye fun àmi. Iwé parallelism (EP) ibiti o yatọ si amoye lori orisirisi GPUs. Ni itọkasi, olulana pinnu iru awọn amoye ti ami ami kọọkan nilo, lẹhinna gbogbo-si-gbogbo igbesẹ ibaraẹnisọrọ dapọ awọn ami si awọn GPU ti o mu awọn amoye ti wọn yan, ṣiṣe FFN, ati dapọ awọn abajade pada. Eyi jẹ ki awoṣe kan ni awọn paramita lapapọ lapapọ (fififo) lakoko ti o n ṣiṣẹ nikan ida kekere kan fun ami-ami (FLOPs kekere). Awọn awoṣe bii Mixtral 8x7B, DeepSeek-V3, ati GPT-OSS lo eyi. Awọn ẹya lile jẹ iwọntunwọnsi fifuye kọja awọn amoye ati iye owo gbogbo-si-gbogbo hops meji fun Layer.
Imọ-imọ-ẹrọ
Mekaniki mojuto jẹ awọn akojọpọ gbogbo-si-gbogbo fun Layer MoE: fifiranṣẹ (firanṣẹ awọn ami si awọn alamọja wọn) ati darapọ (kojọpọ awọn abajade pada). Nitori afisona ni data-ti o gbẹkẹle, awọn nọmba ti àmi lilu kọọkan iwé yatọ, nfa fifuye aiṣedeede ati 'stragglers.' Awọn ọna ṣiṣe n ṣe afikun awọn ifosiwewe agbara, awọn ifibọ iwé, ati fifisilẹ aami tabi padding lati tọju aṣọ GEMMs (matrix multiplies), ati nigbagbogbo ni lqkan ibaraẹnisọrọ gbogbo-si-gbogbo pẹlu iṣiro iwé lati tọju lairi.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Iparapọ Amoye fun MoE Sìn
Reti apẹrẹ iṣọpọ ti ipa-ọna ati ohun elo ohun elo: dispatch-compute-papọ awọn ekuro, awọn GEMM ti o ṣajọpọ ti o ṣajọpọ ọpọlọpọ awọn amoye, ati NVLink/InfiniBand-mọ gbogbo-si-gbogbo. Awọn ilana bii iwọntunwọnsi-pipadanu-ọfẹ ti DeepSeek ati ipa ọna-ipin-ipin dinku ijabọ oju-ọna. Iṣẹ iṣojuuwọn yoo yasọtọ 'iwé' GPUs lọtọ si awọn GPU akiyesi, ati pe awọn iṣiro amoye ti o tobi julọ (awọn ọgọọgọrun) pẹlu oke-k ti o dara julọ yoo Titari MoE si aibikita pupọ lakoko ti o tọju iye owo-ami fun alapin.
Real-World imuse
Ṣiṣẹpọ Mixtral 8x7B kọja 2-4 GPUs nipa gbigbe 2-4 ti awọn amoye 8 rẹ sori ẹrọ kọọkan
DeepSeek-V3 ni lilo ipa ọna-ipin-ipin lati fi ipari melo ni awọn apa ti awọn amoye àmi kan, gige agbedemeji-ipade gbogbo-si-gbogbo
Lilo vLLM tabi SGLang ipo ijuwe-iwé lati gbalejo awoṣe fọnka 200B+ lori ipade 8-GPU kan ṣoṣo
Apapọ iwé parallelism pẹlu tensor parallelism lori akiyesi fẹlẹfẹlẹ ni arabara EP + TP imuṣiṣẹ.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Expert Parallelism for MoE Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Ipilẹ ti a ti pinya ati Di koodu Ṣiṣe
Awọn ibeere ti a beere nigbagbogbo
What is Expert Parallelism for MoE Serving?
Ijuwe ti iwé yapa awoṣe Adapọ-ti-Awọn amoye ni ọpọlọpọ kikọ sii-siwaju 'awọn amoye' kọja awọn GPU oriṣiriṣi nitorina ẹrọ kọọkan di bibẹ pẹlẹbẹ ti awọn paramita nikan. O jẹ bọtini lati ṣiṣẹ awọn awoṣe MoE aimọye-paramita ni idiyele, nitori awọn amoye diẹ nikan nṣiṣẹ fun ami kan.
Kí ni iwé parallelism kaakiri kọja GPUs?
Iparapọ iwé gbe awọn amoye oriṣiriṣi (awọn nẹtiwọọki iha FFN ti Layer MoE) sori awọn GPU oriṣiriṣi, nitorinaa ẹrọ kọọkan ni ipin awọn amoye nikan.
Awoṣe ibaraẹnisọrọ wo ni o jẹ aringbungbun si ibaramu amoye MoE?
Layer MoE kọọkan nilo ohun gbogbo-si-gbogbo lati firanṣẹ awọn ami si awọn amoye wọn ati gbogbo-si-gbogbo miiran lati ṣajọpọ awọn abajade pada.
Kini idi ti MoE jẹ iṣiro-fun-aami ṣe iṣiro kekere laibikita awọn aye titobi lapapọ?
A olulana activates nikan oke-k amoye (igba 1-2) fun àmi, ki FLOPs duro kekere ani tilẹ awọn awoṣe ni o ni ọpọlọpọ awọn amoye ni lapapọ.
Iṣoro wo ni o waye nitori ipa-ọna jẹ igbẹkẹle data?
Niwọn igba ti awọn yiyan olulana da lori titẹ sii, diẹ ninu awọn amoye gba ọpọlọpọ awọn ami-ami diẹ sii ju awọn miiran lọ, ṣiṣẹda aidogba fifuye ati awọn onijagidijagan.
Kini ilana ti o wọpọ lati tọju matrix iwé ti o pọ si aṣọ ni iwọn?
Awọn akopọ ti n ṣiṣẹ ṣeto ṣeto agbara fun-iwé kan (ka iye tokini ti o pọju) ati paadi tabi ju awọn ami silẹ kọja rẹ nitoribẹẹ GEMM iwé kọọkan ni apẹrẹ asọtẹlẹ kan.