Műszaki ÚTMUTATÓ

Szakértői párhuzamosság a KKM kiszolgálásához

A szakértői párhuzamosság szétválasztja a Mixture-of-Experts modell számos előrecsatolt „szakértőjét” a különböző GPU-k között, így minden eszköz csak a paraméterek egy szeletét tartalmazza.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.

Mély merülés

A Mixture-of-Experts (MoE) réteg egy nagy előrecsatolt hálózatot helyettesít sok kisebb hálózattal (szakértővel), valamint egy útválasztóval, amely tokenenként kiválasztja a legjobb k (gyakran 1 vagy 2) szakértőt. A szakértői párhuzamosság (EP) különböző szakértőket helyez a különböző GPU-kra. Következtetésként az útválasztó eldönti, hogy az egyes tokeneknek mely szakértőkre van szüksége, majd egy teljes kommunikációs lépéssel a tokeneket a kiválasztott szakértőket tartó GPU-khoz keverik, futtatják az FFN-t, és visszakeverik az eredményeket. Ez lehetővé teszi, hogy egy modell hatalmas összes paraméterrel rendelkezzen (ritka), miközben tokenenként csak egy kis töredéket aktivál (alacsony FLOP). Az olyan modellek, mint a Mixtral 8x7B, a DeepSeek-V3 és a GPT-OSS használják ezt. A kemény részek a szakértők közötti terheléselosztás és a rétegenkénti két költséges, mindenre kiterjedő ugrás.

Technikai betekintés

A központi mechanika két mindenre kiterjedő kollektíva MoE rétegenként: feladás (tokeneket küld szakértőiknek) és kombinál (kimenetek visszagyűjtése). Mivel az útválasztás adatfüggő, az egyes szakértőket elérő tokenek száma változó, ami terhelési kiegyensúlyozatlanságot és „eltereléseket” okoz. A kiszolgáló rendszerek kapacitástényezőket, szakértői puffereket és jogkivonat-eldobást vagy kitöltést adnak hozzá a GEMM-ek (mátrixszorzók) egységességének megőrzése érdekében, és gyakran átfedik a mindenre kiterjedő kommunikációt a szakértői számításokkal a várakozási idő elrejtése érdekében.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A szakértői párhuzamosság jövője a KKM kiszolgálásában

Az útválasztás és a hardver szorosabb közös tervezésére számíthat: egybeolvadt küldés-számítás-kombináció kernelek, csoportosított GEMM-ek, amelyek sok szakértőt tömörítenek, és az NVLink/InfiniBand-tudatos all-to-all. Az olyan technikák, mint a DeepSeek kiegészítő veszteségmentes kiegyensúlyozása és csomópont-korlátozott útválasztás, csökkentik a csomópontok közötti forgalmat. A lebontott kiszolgálás a „szakértői” GPU-kat különválasztja a figyelemfelkeltő GPU-któl, a nagyobb szakértői létszámok (százak) pedig finomabb top-k-vel a rendkívül ritkaság felé tolják a MoE-t, miközben a tokenenkénti költségek változatlanok maradnak.

Valós megvalósítás

A Mixtral 8x7B kiszolgálása 2-4 GPU-n keresztül úgy, hogy a 8 szakértőből 2-4 minden eszközre kerül

A DeepSeek-V3 csomópont-korlátozott útválasztással korlátozza, hogy egy token szakértői hány csomópontot fedjenek le, így a csomópontok közötti csomópontokat mindenre vágják

A vLLM vagy az SGLang szakértői párhuzamos mód használata 200 milliárd feletti ritka modell elhelyezésére egyetlen 8 GPU-s csomóponton

A szakértői párhuzamosság és a tenzorpárhuzam kombinálása figyelemrétegeken egy hibrid EP+TP telepítésben

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Bontott előtöltési és dekódolási szolgáltatás

Gyakran ismételt kérdések

What is Expert Parallelism for MoE Serving?

A szakértői párhuzamosság szétválasztja a Mixture-of-Experts modell számos előrecsatolt „szakértőjét” a különböző GPU-k között, így minden eszköz csak a paraméterek egy szeletét tartalmazza. Ez a kulcsa a billió paraméterű MoE modellek olcsó kiszolgálásának, mivel csak néhány szakértő fut tokenenként.

Mi oszlik meg a szakértői párhuzamosság a GPU-k között?

A szakértői párhuzamosság különböző szakértőket (egy MoE-réteg FFN-alhálózatait) helyezi el a különböző GPU-kon, így minden eszközön csak a szakértők egy része van.

Melyik kommunikációs minta központi szerepet játszik a MeH szakértői párhuzamosságában?

Minden MoE-rétegnek általában szüksége van egy all-to-all-ra, hogy a tokeneket elküldje szakértőinek, és egy másik all-to-all-ra, hogy visszakombinálja a kimeneteket.

Miért tartja a MoE alacsonyan a tokenenkénti számítást a hatalmas összparaméterek ellenére?

Egy útválasztó csak top k szakértőt (gyakran 1-2) aktivál tokenenként, így a FLOP-ok kicsik maradnak, bár a modellben összesen sok szakértő van.

Milyen probléma adódik, mert az útválasztás adatfüggő?

Mivel az útválasztó választásai a bemenettől függenek, egyes szakértők sokkal több tokent kapnak, mint mások, ami terhelési egyensúlyhiányt és vándorlást okoz.

Mi az elterjedt technika a szakértői mátrixszorzók egységes méretű megőrzésére?

A kiszolgálási halmok szakértőnkénti kapacitást (maximális tokenszámot) állítanak be, és ezen túlmenően a tokeneket helyezik el vagy dobják be, így minden szakértő GEMM-je kiszámítható alakkal rendelkezik.