Als nächstesNächster Leitfaden
Disaggregierte Vorabfüllung und Dekodierungsbereitstellung
Technisch
Technischer Leitfaden
Die Expertenparallelität teilt die vielen Feed-Forward-„Experten“ eines Mixture-of-Experts-Modells auf verschiedene GPUs auf, sodass jedes Gerät nur einen Teil der Parameter enthält.
It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.
Eine Mixture-of-Experts (MoE)-Schicht ersetzt ein großes Feed-Forward-Netzwerk durch viele kleinere (Experten) sowie einen Router, der die Top-K-Experten (häufig 1 oder 2) pro Token auswählt. Bei der Expertenparallelität (EP) werden unterschiedliche Experten auf unterschiedliche GPUs verteilt. Bei der Schlussfolgerung entscheidet der Router, welche Experten jeder Token benötigt. Anschließend werden in einem All-to-All-Kommunikationsschritt die Token an die GPUs mit den ausgewählten Experten gemischt, das FFN ausgeführt und die Ergebnisse zurückgemischt. Dadurch kann ein Modell große Gesamtparameter (sparse) haben, während nur ein kleiner Bruchteil pro Token aktiviert wird (niedrige FLOPs). Modelle wie Mixtral 8x7B, DeepSeek-V3 und GPT-OSS nutzen dies. Die schwierigen Teile sind der Lastausgleich zwischen Experten und die zwei kostspieligen All-to-All-Hops pro Schicht.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Erwarten Sie ein engeres Co-Design von Routing und Hardware: verschmolzene Dispatch-Compute-Combine-Kernel, gruppierte GEMMs, die viele Experten zusammenfassen, und NVLink/InfiniBand-fähiges All-to-All. Techniken wie der verlustfreie Hilfsausgleich von DeepSeek und das knotenbegrenzte Routing reduzieren den knotenübergreifenden Datenverkehr. Durch die disaggregierte Bereitstellung werden „Experten“-GPUs getrennt von Aufmerksamkeits-GPUs zugewiesen, und größere Expertenzahlen (Hunderte) mit feinerem Top-K werden MoE in Richtung extremer Sparsity treiben, während die Kosten pro Token flach bleiben.
Bereitstellung von Mixtral 8x7B über 2–4 GPUs durch Platzierung von 2–4 seiner 8 Experten auf jedem Gerät
DeepSeek-V3 verwendet knotenbegrenztes Routing, um die Anzahl der Knoten zu begrenzen, die die Experten eines Tokens umfassen, und so die Gesamtverteilung zwischen den Knoten zu reduzieren
Verwenden des vLLM- oder SGLang-Experten-Parallelmodus zum Hosten eines 200B+ Sparse-Modells auf einem einzelnen 8-GPU-Knoten
Kombination von Expertenparallelität mit Tensorparallelität auf Aufmerksamkeitsebenen in einer hybriden EP+TP-Bereitstellung
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Die Expertenparallelität teilt die vielen Feed-Forward-„Experten“ eines Mixture-of-Experts-Modells auf verschiedene GPUs auf, sodass jedes Gerät nur einen Teil der Parameter enthält. Dies ist der Schlüssel zur kostengünstigen Bereitstellung von MoE-Modellen mit Billionen Parametern, da nur wenige Experten pro Token arbeiten.
Durch die Expertenparallelität werden verschiedene Experten (die FFN-Subnetzwerke einer MoE-Schicht) auf verschiedenen GPUs platziert, sodass jedes Gerät nur eine Teilmenge von Experten enthält.
Jede MoE-Schicht benötigt typischerweise einen All-to-All, um Token an ihre Experten zu versenden, und einen weiteren All-to-All, um die Ausgaben zurück zu kombinieren.
Ein Router aktiviert nur Top-K-Experten (häufig 1-2) pro Token, sodass FLOPs klein bleiben, obwohl das Modell insgesamt über viele Experten verfügt.
Da die Entscheidungen des Routers von der Eingabe abhängen, erhalten einige Experten viel mehr Token als andere, was zu Lastungleichgewichten und Nachzüglern führt.
Servierstapel legen eine Kapazität pro Experte fest (eine maximale Token-Anzahl) und legen darüber hinaus Token auf oder lassen sie fallen, damit das GEMM jedes Experten eine vorhersehbare Form hat.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Disaggregierte Vorabfüllung und Dekodierungsbereitstellung
Technisch