Jagorar Fasaha

Daidaitawar Kwararru don Hidimar MoE

Daidaitawar ƙwararru ta raba ƙirar ƙwararrun masana'antu da yawa na ciyarwar gaba a cikin GPUs daban-daban don haka kowace na'ura tana riƙe da yanki kaɗan na sigogi.

2 min karatuAn sabunta ta ƙarshe

Dubawa

It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.

Zurfafa nutsewa

A Mixture-of-Experts Layer (MoE) ya maye gurbin babbar hanyar sadarwa ta gaba ɗaya tare da ƙananan ƙananan (masana) da na'ura mai ba da hanya tsakanin hanyoyin sadarwa wanda ke ɗaukar manyan-k (sau da yawa 1 ko 2) masana kowace alama. Daidaiton ƙwararru (EP) yana sanya masana daban-daban akan GPUs daban-daban. A ra'ayi, na'ura mai ba da hanya tsakanin hanyoyin sadarwa ya yanke shawarar waɗanne ƙwararrun kowace alamar ke buƙata, sannan matakin sadarwa na gaba-da-zuwa yana jujjuya alamu zuwa GPUs da ke riƙe da zaɓaɓɓun ƙwararrun da suka zaɓa, suna gudanar da FFN, kuma suna jujjuya sakamakon baya. Wannan yana ƙyale samfurin ya sami ɗimbin ma'auni (mai rahusa) yayin kunna ƙaramin juzu'i a kowace alama (ƙananan FLOPs). Samfura kamar Mixtral 8x7B, DeepSeek-V3, da GPT-OSS suna amfani da wannan. Ƙaƙƙarfan sassa suna daidaita ma'aunin ƙwararru da ƙwararru biyu masu tsada duka-zuwa-duka a kowane Layer.

Fahimtar Fasaha

Babban makanikin shine gama-gari guda biyu-zuwa-duka a kowane Layer na MoE: aikawa (aika alamu ga ƙwararrun su) da haɗa ( tattara abubuwan da aka dawo dasu). Saboda hanyar tuƙi ya dogara da bayanai, adadin alamun da ke bugun kowane ƙwararre ya bambanta, yana haifar da rashin daidaituwar kaya da 'yan iska.' Serving systems add capacity factors, expert buffers, and token dropping or padding to keep GEMMs (matrix multiplies) uniform, and often overlap the all-to-all communication with expert computation to hide latency.

Dabarun Tasiri

Kudin da kasafin kuɗi

Hukunce-hukuncen gine-gine suna haifar da aiki da tsadar aiki na shekaru.

Shawarwari masu haske

Ilimin fasaha yana taimaka wa ƙungiyoyi su zaɓi tari mai kyau, ba kawai sabon abu ba.

Kula da inganci

Zaɓuɓɓukan injiniya mafi kyau suna rage abin dogaro a cikin samarwa.

Makomar Ƙwararrun Ƙwararru don Hidimar MoE

Yi tsammanin tsantsar ƙira ta hanyar zirga-zirga da kayan masarufi: haɗaɗɗen aika-ƙididdigar-haɗa kernels, ƙungiyoyin GEMMs waɗanda ke ba da ƙwararrun masana da yawa, da NVLink/InfiniBand-sane da duk-zuwa-duka. Dabaru kamar DeepSeek's ma'auni-kyauta na taimako-asara da iyaka-ƙulli yana rage zirga-zirgar kuɗaɗe. Hidimar da aka raba za ta keɓe 'gwani' GPUs daban da GPUs mai hankali, kuma ƙwararrun ƙwararrun ƙwararrun ƙididdiga (ɗaruruwan) tare da mafi kyawun saman-k za su tura MoE zuwa matsananciyar ɓacin rai yayin kiyaye farashin kowane-lala'i.

Aiwatar da Gaskiyar Duniya

Yin hidimar Mixtral 8x7B a cikin 2-4 GPUs ta hanyar sanya 2-4 na ƙwararrunsa 8 akan kowace na'ura

DeepSeek-V3 ta yin amfani da iyakantaccen kuɗaɗe don ɗaukar nodes nawa ƙwararrun ƙwararrun alamar ke faɗi, yankan tsaka-tsakin-zuwa-duka.

Yin amfani da vLLM ko SGLang ƙwararriyar yanayi-daidaitacce don ɗaukar nauyin ƙirar 200B+ akan kullin 8-GPU guda ɗaya.

Haɗa daidaiton ƙwararru tare da daidaitawar tensor akan matakan kulawa a cikin jigilar EP+TP matasan

Hatsari & Tsare-tsare

Haɓaka ma'auni ɗaya na iya ɓoye manyan raunin tsarin.

Sau da yawa ana raina kayan more rayuwa da kuma kuɗin kulawa.

Tsaro da gibin lura na iya girma yayin da tsarin ke ƙara haɓaka.

Taswirar Hanya

1

Ƙayyade latency, inganci, da maƙasudin farashi kafin aiwatarwa.

2

Alamar ma'auni a ƙarƙashin ainihin kaya da yanayin bayanai.

3

Kula da kayan aiki don kurakurai, ɗigo, da tasirin mai amfani.

4

Shirya bijirowa da hanyoyin mayar da martani kafin sikeli.

Ci gaba da Bincike

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Fara tambayoyi

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Jagora na gaba

Cikawar da aka raba da yanke Hidima

Tambayoyin da ake yawan yi

What is Expert Parallelism for MoE Serving?

Daidaitawar ƙwararru ta raba ƙirar ƙwararrun masana'antu da yawa na ciyarwar gaba a cikin GPUs daban-daban don haka kowace na'ura tana riƙe da yanki kaɗan na sigogi. Yana da mabuɗin don ba da samfuran MoE na siga na tiriliyan a rahusa, tunda ƴan ƙwararrun ƙwararru ne kawai ke gudanar da kowace alama.

Menene daidaiton ƙwararru ke rarrabawa a cikin GPUs?

Daidaitawar ƙwararru yana sanya ƙwararru daban-daban (haɗin kai na FFN na layin MoE) akan GPUs daban-daban, don haka kowace na'ura tana riƙe da rukunin masana kawai.

Wane tsarin sadarwa ne ke tsakiyar daidaitawar ƙwararrun MoE?

Kowane Layer MoE yawanci yana buƙatar duka-duka-duka don aika alamu ga ƙwararrun su da kuma wani duka-duka-duka don haɗa abubuwan da aka fitar baya.

Me yasa MoE ke ci gaba da ƙididdige ƙididdiga ta kowace alama duk da ɗimbin sigogi?

Mai na'ura mai ba da hanya tsakanin hanyoyin sadarwa yana kunna ƙwararrun top-k kawai (sau da yawa 1-2) kowace alama, don haka FLOPs suna ƙanƙanta duk da cewa ƙirar tana da ƙwararru da yawa gabaɗaya.

Wace matsala ce ta taso saboda kwatancen ya dogara da bayanai?

Tunda zaɓin na'ura mai ba da hanya tsakanin hanyoyin sadarwa ya dogara da shigarwar, wasu ƙwararru suna karɓar alamu da yawa fiye da wasu, suna haifar da rashin daidaituwar kaya da masu ɓarna.

Menene dabara na gama gari don kiyaye matrix ƙwararru yana ninka uniform cikin girman?

Tambuwal ɗin hidima yana saita ƙarfin kowane ƙwararre (ƙididdigar ƙidayar alama) da pad ko sauke alamun sama da shi don haka GEMM na ƙwararru yana da siffa mai iya tsinkaya.