Als nächstesNächster Leitfaden
Mischung aus LoRA-Experten
Technisch
Technischer Leitfaden
Mixture of Experts (MoE) ist ein Modelldesign, das ein Netzwerk in viele spezialisierte Subnetzwerke aufteilt und nur wenige pro Eingabe aktiviert.
It lets models hold enormous knowledge while keeping each prediction fast and cheap.
Ein Standardtransformator leitet jeden Eingang durch dieselben dichten Schichten, sodass die Verbesserung des Modells normalerweise bedeutet, dass jede Berechnung teurer wird. Mixture of Experts bricht diese Verbindung. Es ersetzt die große Feed-Forward-Schicht durch viele kleinere „Experten“-Netzwerke sowie einen kleinen „Router“, der entscheidet, welche Experten mit jedem Token umgehen. Normalerweise feuern nur die besten 1 oder 2 Experten, sodass ein Modell über Hunderte Milliarden Gesamtparameter verfügen kann, aber nur einen kleinen Bruchteil pro Token aktiviert. Aus diesem Grund erreichen Modelle wie Mixtral 8x7B und die angebliche Architektur hinter GPT-4 eine hohe Qualität ohne verhältnismäßig hohe Inferenzkosten. Der Kompromiss besteht in der Komplexität: Alle Experten müssen noch in den Speicher passen, und der Router kann einige Experten falsch weiterleiten oder überlasten, sodass beim Training ein sorgfältiger Ausgleich erforderlich ist.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
MoE wird zum Standardwerkzeug für Modelle im Grenzmaßstab, da es die Kapazität von den Kosten entkoppelt. Erwarten Sie feinkörnigere Experten, intelligenteres Routing, das mehr Kontext berücksichtigt, und bessere Techniken für die Bereitstellung riesiger spärlicher Modelle auf begrenzter Hardware. Die Forschung befasst sich auch mit dem Speicherproblem, da durch Experten-Offloading und Quantisierung alle Experten geladen werden müssen, auch wenn nur wenige ausgeführt werden. Mit zunehmender Reife offener Modelle wie Mixtral und DeepSeek-MoE werden spärliche Architekturen wahrscheinlich effizientere Assistenten mit kleineren GPU-Budgets ermöglichen.
Mixtral 8x7B verwendet 8 Experten und aktiviert 2 pro Token, was ungefähr 47B Gesamtparameter ergibt, aber nur ~13B aktiv pro Token für schnellere und kostengünstigere Schlussfolgerungen.
DeepSeek und Qwen liefern große MoE-Sprachmodelle, die bei Benchmarks mit dichten Modellen übereinstimmen und gleichzeitig mit geringerer Rechenleistung pro Token ausgeführt werden.
Cloud-LLM-Anbieter nutzen MoE, sodass ein einziges großes Modell viele Benutzer kostengünstig bedienen kann, da jede Anfrage nur wenige Experten anspricht.
Der frühere Switch Transformer von Google wurde mithilfe von Top-1-Routing auf über eine Billion Parameter skaliert, um die Trainingsrechenleistung überschaubar zu halten.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mixture of Experts (MoE) ist ein Modelldesign, das ein Netzwerk in viele spezialisierte Subnetzwerke aufteilt und nur wenige pro Eingabe aktiviert. Dadurch können Modelle enormes Wissen speichern und gleichzeitig jede Vorhersage schnell und kostengünstig durchführen.
Ein kleines Gating-Netzwerk lernt, jeden Experten für den Token zu bewerten und leitet ihn an die Experten mit der höchsten Punktzahl weiter. Das Routing wird erlernt, nicht festgelegt oder zufällig.
Da nur die Top-k-Experten pro Token feuern, bleibt die aktive Rechenleistung ungefähr konstant, auch wenn die Gesamtparameterzahl durch das Hinzufügen weiterer Experten zunimmt.
Ohne Ausbalancierung tendiert der Router dazu, einer Handvoll Experten den Vorzug zu geben. Der Hilfsverlust bestraft eine ungleichmäßige Nutzung, sodass alle Experten geschult werden.
Da nur 2 von 8 Experten aktiv sind, sind die aktiven Parameter pro Token (~13B) viel kleiner als die insgesamt ~47B, was die Inferenzkosten senkt.
Obwohl nur wenige Experten pro Token rechnen, müssen die Gewichte jedes Experten in den Speicher geladen werden, was die Bereitstellung von MoE-Modellen speicherhungrig macht.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Mischung aus LoRA-Experten
Technisch