Műszaki ÚTMUTATÓ

Szakértők keveréke

A Mixture of Experts (MoE) egy olyan modellterv, amely a hálózatot számos speciális alhálózatra bontja, és bemenetenként csak néhányat aktivál.

2 perc olvasásUtoljára frissítve

Áttekintés

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

Mély merülés

Egy szabványos transzformátor minden bemenetet ugyanazon a sűrű rétegeken fut át, így a modell intelligensebbé tétele általában azt jelenti, hogy minden számítást megdrágítanak. A szakértők keveréke megszakítja ezt a kapcsolatot. A nagy előrecsatolási réteget sok kisebb „szakértői” hálózatra, valamint egy kis „útválasztóra” cseréli, amely eldönti, hogy mely szakértők kezeljék az egyes tokent. Általában csak a legjobb 1 vagy 2 szakértő tüzel, így egy modell több százmilliárd paraméterrel rendelkezhet, de tokenenként csak egy kis töredéket aktivál. Ez az oka annak, hogy az olyan modellek, mint a Mixtral 8x7B és a GPT-4 mögötti híresztelésű architektúra magas minőséget érnek el arányosan magas következtetési költségek nélkül. A kompromisszum az összetettség: minden szakértőnek el kell férnie a memóriában, és az útválasztó félreirányíthat vagy túlterhelhet néhány szakértőt, ezért a képzés gondos egyensúlyozást igényel.

Technikai betekintés

A MoE szíve a kapuzási hálózat, egy kis tanult réteg, amely minden szakértőt pontoz egy bejövő tokenért, és a tokent a legjobb k legmagasabb pontszámot elérőhöz irányítja (gyakran k=1 vagy 2). Annak megakadályozására, hogy a router mindent néhány kedvenc szakértőnek küldjön, a képzés egy kiegészítő „terheléselosztási veszteséget” ad hozzá, amely bünteti az egyenetlen használatot. Mivel tokenenként csak k szakértő fut, a számítás (FLOP) nagyjából állandó marad, még akkor is, ha további szakértőket ad hozzá, így a teljes paraméterek és a tokenenkénti költség egymástól függetlenül skálázódik.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A szakértői keverék jövője

A MoE a határ menti modellek alapértelmezett eszközévé válik, mert leválasztja a kapacitást a költségekről. Finomabb szakértőkre, intelligensebb, több kontextust figyelembe vevő útválasztásra és jobb technikákra számíthat a hatalmas, ritka modellek korlátozott hardveren történő kiszolgálására. A kutatás a memóriaproblémával is foglalkozik, mivel minden szakértőt be kell tölteni, még akkor is, ha csak kevesen futnak, szakértői kitöltés és kvantálás révén. Ahogy a nyitott modellek, például a Mixtral és a DeepSeek-MoE érnek, a ritka architektúrák valószínűleg hatékonyabb asszisztenseket biztosítanak majd kisebb GPU-költségvetés mellett.

Valós megvalósítás

A Mixtral 8x7B 8 szakértőt használ, és tokenenként 2-t aktivál, így nagyjából 47 milliárd teljes paramétert ad, de tokenenként csak ~13 milliárd aktív a gyorsabb és olcsóbb következtetés érdekében.

A DeepSeek és a Qwen nagy MoE nyelvi modelleket szállít, amelyek megfelelnek a sűrű modelleknek a benchmarkokon, miközben alacsonyabb tokenenkénti számítással futnak.

A Cloud LLM szolgáltatók a MoE-t használják, így egyetlen hatalmas modell sok felhasználót tud megfizethetően kiszolgálni, mivel minden kérés csak néhány szakértőt világít meg.

A Google korábbi Switch Transformer-jét több mint billió paraméterre méretezték az első számú útválasztással, hogy a képzési számítások kezelhetőek legyenek.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

LoRA szakértők keveréke

Gyakran ismételt kérdések

What is Mixture of Experts?

A Mixture of Experts (MoE) egy olyan modellterv, amely a hálózatot számos speciális alhálózatra bontja, és bemenetenként csak néhányat aktivál. Lehetővé teszi a modellek számára, hogy hatalmas tudást birtokoljanak, miközben minden előrejelzést gyorsan és olcsón tartanak.

A Szakértők keveréke rétegben mi dönti el, hogy mely szakértők dolgozzanak fel egy adott tokent?

Egy kis kapuzóhálózat megtanul minden szakértőt pontozni a tokenért, és a legjobb pontszámot elérőkhöz irányítja. Az útválasztás tanult, nem rögzített vagy véletlenszerű.

Miért lehet egy MoE-modellnek sokkal több teljes paramétere, mint egy sűrű modellnek anélkül, hogy a tokenenkénti költség ennek megfelelően növekedne?

Mivel tokenenként csak a legjobb k szakértő aktiválódik, az aktív számítás nagyjából állandó marad, még akkor is, ha a paraméterek teljes száma több szakértő hozzáadásával nő.

Milyen problémát old meg a terheléselosztási (kiegészítő) veszteség a KM képzés során?

Kiegyensúlyozás nélkül az útválasztó inkább egy maroknyi szakértőt részesít előnyben. A kiegészítő veszteség bünteti az egyenetlen használatot, így minden szakértő képzésben részesül.

A Mixtral 8x7B tokenenként 8 szakértőjéből kettőt aktivál. Mit jelent ez a számítási teljesítményére és a méretére vonatkozóan?

Mivel a 8 szakértőből csak 2 aktív, az aktív paraméterek tokenenként (~13B) sokkal kisebbek, mint a teljes ~47B, ami csökkenti a következtetési költséget.

Mi az igazi hátránya a MoE modelleknek az ugyanolyan képességű sűrű modellekhez képest?

Bár csak néhány szakértő számol tokenenként, minden szakértő súlyát be kell tölteni a memóriába, így a MoE modellek memóriaéhesek a kiszolgáláshoz.