Imọ Itọsọna

Iparapọ Amoye fun MoE Sìn

Ijuwe ti iwé yapa awoṣe Adapọ-ti-Awọn amoye ni ọpọlọpọ kikọ sii-siwaju 'awọn amoye' kọja awọn GPU oriṣiriṣi nitorina ẹrọ kọọkan di bibẹ pẹlẹbẹ ti awọn paramita nikan.

2 min kakẹhin imudojuiwọn

Akopọ

It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.

Jin Dive

Apapọ-ti-Amoye (MoE) Layer rọpo ọkan nla kikọ sii-siwaju nẹtiwọki pẹlu ọpọlọpọ awọn kere (awọn amoye) pẹlu olulana ti o gbe oke-k (igba 1 tabi 2) amoye fun àmi. Iwé parallelism (EP) ibiti o yatọ si amoye lori orisirisi GPUs. Ni itọkasi, olulana pinnu iru awọn amoye ti ami ami kọọkan nilo, lẹhinna gbogbo-si-gbogbo igbesẹ ibaraẹnisọrọ dapọ awọn ami si awọn GPU ti o mu awọn amoye ti wọn yan, ṣiṣe FFN, ati dapọ awọn abajade pada. Eyi jẹ ki awoṣe kan ni awọn paramita lapapọ lapapọ (fififo) lakoko ti o n ṣiṣẹ nikan ida kekere kan fun ami-ami (FLOPs kekere). Awọn awoṣe bii Mixtral 8x7B, DeepSeek-V3, ati GPT-OSS lo eyi. Awọn ẹya lile jẹ iwọntunwọnsi fifuye kọja awọn amoye ati iye owo gbogbo-si-gbogbo hops meji fun Layer.

Imọ-imọ-ẹrọ

Mekaniki mojuto jẹ awọn akojọpọ gbogbo-si-gbogbo fun Layer MoE: fifiranṣẹ (firanṣẹ awọn ami si awọn alamọja wọn) ati darapọ (kojọpọ awọn abajade pada). Nitori afisona ni data-ti o gbẹkẹle, awọn nọmba ti àmi lilu kọọkan iwé yatọ, nfa fifuye aiṣedeede ati 'stragglers.' Awọn ọna ṣiṣe n ṣe afikun awọn ifosiwewe agbara, awọn ifibọ iwé, ati fifisilẹ aami tabi padding lati tọju aṣọ GEMMs (matrix multiplies), ati nigbagbogbo ni lqkan ibaraẹnisọrọ gbogbo-si-gbogbo pẹlu iṣiro iwé lati tọju lairi.

Ipa Ilana

Iye owo ati isuna

Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.

Awọn ipinnu diẹ sii

Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.

Iṣakoso didara

Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.

Ojo iwaju ti Iparapọ Amoye fun MoE Sìn

Reti apẹrẹ iṣọpọ ti ipa-ọna ati ohun elo ohun elo: dispatch-compute-papọ awọn ekuro, awọn GEMM ti o ṣajọpọ ti o ṣajọpọ ọpọlọpọ awọn amoye, ati NVLink/InfiniBand-mọ gbogbo-si-gbogbo. Awọn ilana bii iwọntunwọnsi-pipadanu-ọfẹ ti DeepSeek ati ipa ọna-ipin-ipin dinku ijabọ oju-ọna. Iṣẹ iṣojuuwọn yoo yasọtọ 'iwé' GPUs lọtọ si awọn GPU akiyesi, ati pe awọn iṣiro amoye ti o tobi julọ (awọn ọgọọgọrun) pẹlu oke-k ti o dara julọ yoo Titari MoE si aibikita pupọ lakoko ti o tọju iye owo-ami fun alapin.

Real-World imuse

Ṣiṣẹpọ Mixtral 8x7B kọja 2-4 GPUs nipa gbigbe 2-4 ti awọn amoye 8 rẹ sori ẹrọ kọọkan

DeepSeek-V3 ni lilo ipa ọna-ipin-ipin lati fi ipari melo ni awọn apa ti awọn amoye àmi kan, gige agbedemeji-ipade gbogbo-si-gbogbo

Lilo vLLM tabi SGLang ipo ijuwe-iwé lati gbalejo awoṣe fọnka 200B+ lori ipade 8-GPU kan ṣoṣo

Apapọ iwé parallelism pẹlu tensor parallelism lori akiyesi fẹlẹfẹlẹ ni arabara EP + TP imuṣiṣẹ.

Awọn ewu & Awọn ọna iṣọ

Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.

Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.

Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.

Ilana Ilana imuse

1

Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.

2

Aṣepari labẹ ẹru ojulowo ati awọn ipo data.

3

Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.

4

Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Itọsọna atẹle

Ipilẹ ti a ti pinya ati Di koodu Ṣiṣe

Awọn ibeere ti a beere nigbagbogbo

What is Expert Parallelism for MoE Serving?

Ijuwe ti iwé yapa awoṣe Adapọ-ti-Awọn amoye ni ọpọlọpọ kikọ sii-siwaju 'awọn amoye' kọja awọn GPU oriṣiriṣi nitorina ẹrọ kọọkan di bibẹ pẹlẹbẹ ti awọn paramita nikan. O jẹ bọtini lati ṣiṣẹ awọn awoṣe MoE aimọye-paramita ni idiyele, nitori awọn amoye diẹ nikan nṣiṣẹ fun ami kan.

Kí ni iwé parallelism kaakiri kọja GPUs?

Iparapọ iwé gbe awọn amoye oriṣiriṣi (awọn nẹtiwọọki iha FFN ti Layer MoE) sori awọn GPU oriṣiriṣi, nitorinaa ẹrọ kọọkan ni ipin awọn amoye nikan.

Awoṣe ibaraẹnisọrọ wo ni o jẹ aringbungbun si ibaramu amoye MoE?

Layer MoE kọọkan nilo ohun gbogbo-si-gbogbo lati firanṣẹ awọn ami si awọn amoye wọn ati gbogbo-si-gbogbo miiran lati ṣajọpọ awọn abajade pada.

Kini idi ti MoE jẹ iṣiro-fun-aami ṣe iṣiro kekere laibikita awọn aye titobi lapapọ?

A olulana activates nikan oke-k amoye (igba 1-2) fun àmi, ki FLOPs duro kekere ani tilẹ awọn awoṣe ni o ni ọpọlọpọ awọn amoye ni lapapọ.

Iṣoro wo ni o waye nitori ipa-ọna jẹ igbẹkẹle data?

Niwọn igba ti awọn yiyan olulana da lori titẹ sii, diẹ ninu awọn amoye gba ọpọlọpọ awọn ami-ami diẹ sii ju awọn miiran lọ, ṣiṣẹda aidogba fifuye ati awọn onijagidijagan.

Kini ilana ti o wọpọ lati tọju matrix iwé ti o pọ si aṣọ ni iwọn?

Awọn akopọ ti n ṣiṣẹ ṣeto ṣeto agbara fun-iwé kan (ka iye tokini ti o pọju) ati paadi tabi ju awọn ami silẹ kọja rẹ nitoribẹẹ GEMM iwé kọọkan ni apẹrẹ asọtẹlẹ kan.