Technische GIDS

Mengsel van deskundigen

Mixture of Experts (MoE) is een modelontwerp dat een netwerk opsplitst in vele gespecialiseerde subnetwerken en er slechts een paar per ingang activeert.

2 min readLaatst bijgewerkt

Overzicht

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

Diepe duik

Een standaardtransformator leidt elke invoer door dezelfde dichte lagen, dus het slimmer maken van het model betekent meestal dat elke berekening duurder wordt. Mengsel van deskundigen verbreekt die link. Het vervangt de grote feed-forward-laag door veel kleinere 'expertnetwerken' plus een kleine 'router' die beslist welke experts met elk token omgaan. Normaal gesproken vuren alleen de beste 1 of 2 experts, dus een model kan honderden miljarden totale parameters hebben, maar slechts een klein deel per token activeren. Dit is de reden waarom modellen als Mixtral 8x7B en de geruchtenarchitectuur achter GPT-4 hoge kwaliteit bereiken zonder proportioneel hoge inferentiekosten. De wisselwerking is complexiteit: alle experts moeten nog steeds in het geheugen passen, en de router kan sommige experts verkeerd routeren of overbelasten, dus training vereist een zorgvuldige afweging.

Technisch inzicht

Het hart van MoE is het poortnetwerk, een kleine geleerde laag die elke expert een score geeft voor een inkomend token en het token doorstuurt naar de top-k hoogste scorers (vaak k = 1 of 2). Om te voorkomen dat de router alles naar een paar favoriete experts stuurt, voegt training een extra 'load-balancing loss' toe die ongelijkmatig gebruik bestraft. Omdat er slechts k experts per token draaien, blijft de compute (FLOP's) ongeveer constant, zelfs als u meer experts toevoegt, zodat de totale parameters en de kosten per token onafhankelijk van elkaar kunnen worden geschaald.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van een mix van experts

MoE wordt een standaardinstrument voor modellen op grensschaal, omdat het capaciteit loskoppelt van de kosten. Verwacht fijnmazige experts, slimmere routering die meer context in aanmerking neemt, en betere technieken voor het bedienen van enorme schaarse modellen op beperkte hardware. Onderzoek pakt ook het geheugenprobleem aan, omdat alle experts moeten worden belast, ook al zijn er maar weinigen, door middel van expert-offloading en kwantisering. Naarmate open modellen zoals Mixtral en DeepSeek-MoE volwassen worden, zullen schaarse architecturen waarschijnlijk efficiëntere assistenten aandrijven met kleinere GPU-budgetten.

Implementatie in de echte wereld

Mixtral 8x7B gebruikt 8 experts en activeert er 2 per token, wat ongeveer 47 miljard totale parameters oplevert, maar slechts ~13 miljard actief per token voor snellere, goedkopere gevolgtrekking.

DeepSeek en Qwen leveren grote MoE-taalmodellen die overeenkomen met compacte modellen op benchmarks, terwijl ze draaien met een lagere rekenkracht per token.

Cloud LLM-providers gebruiken MoE, zodat één groot model veel gebruikers betaalbaar kan bedienen, aangezien elk verzoek slechts een paar experts aanspreekt.

De eerdere Switch Transformer van Google is geschaald naar meer dan een biljoen parameters met behulp van top-1-routering om de trainingscomputer beheersbaar te houden.

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Mengsel van LoRA-experts

Frequently asked questions

What is Mixture of Experts?

Mixture of Experts (MoE) is een modelontwerp dat een netwerk opsplitst in vele gespecialiseerde subnetwerken en er slechts een paar per ingang activeert. Het zorgt ervoor dat modellen enorme kennis kunnen verzamelen en tegelijkertijd elke voorspelling snel en goedkoop kunnen houden.

Wat bepaalt in een mix van experts-laag welke experts een bepaald token verwerken?

Een klein poortnetwerk leert elke expert een score te geven voor het token en stuurt deze naar de best scorende. Routering is aangeleerd, niet vast of willekeurig.

Waarom kan een MoE-model veel meer totale parameters hebben dan een compact model zonder een overeenkomstige stijging van de kosten per token?

Omdat alleen de beste experts per token vuren, blijft de actieve rekenkracht ongeveer constant, zelfs als het totale aantal parameters toeneemt door meer experts toe te voegen.

Welk probleem wordt opgelost door een taakverdelingsverlies (hulpverlies) tijdens MoE-training?

Zonder evenwicht heeft de router de neiging de voorkeur te geven aan een handvol experts. Het extra verlies bestraft ongelijkmatig gebruik, zodat alle experts worden opgeleid.

Mixtral 8x7B activeert 2 van zijn 8 experts per token. Wat betekent dit over de rekenkracht versus de omvang ervan?

Omdat slechts 2 van de 8 actieve experts actief zijn, zijn de actieve parameters per token (~13 miljard) veel kleiner dan het totaal van ~47 miljard, waardoor de gevolgtrekkingskosten worden verlaagd.

Wat is een echt nadeel van MoE-modellen vergeleken met even capabele compacte modellen?

Ook al berekenen slechts een paar experts per token, de gewichten van elke expert moeten in het geheugen worden geladen, waardoor MoE-modellen geheugenhongerig zijn om te dienen.