Technische GIDS

Mixtrale en schaarse modellen

Mixtral is het open mix-of-experts-model van Mistral AI dat kwaliteit van grote modellen levert met de snelheid van kleine modellen.

2 min readLaatst bijgewerkt

Overzicht

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Diepe duik

Mixtral 8x7B, eind 2023 uitgebracht door Mistral AI, maakte de schaarse mix-of-experts (MoE)-benadering in open modellen populair. Het bevat acht afzonderlijke 'expert' feed-forward-netwerken per laag, met in totaal ongeveer 47 miljard parameters, maar een lichtgewicht router selecteert slechts twee experts voor elk token. Als gevolg hiervan zijn er slechts ruwweg 13 miljard parameters per token actief, dus de gevolgtrekking loopt ongeveer net zo snel als een 13B-dicht model, terwijl een kwaliteit wordt bereikt die vergelijkbaar is met veel grotere. Mixtral evenaarde of versloeg GPT-3.5 en Llama 2 70B op veel benchmarks, terwijl het sneller en goedkoper was om te bedienen. Mistral bracht later Mixtral 8x22B uit. Het model is openlijk gelicentieerd onder Apache 2.0, wat een snelle acceptatie en verfijning in de open-sourcegemeenschap stimuleert.

Technisch inzicht

In een schaarse MoE-laag wordt het dichte feed-forward-blok vervangen door N expertnetwerken plus een klein poortnetwerk (de router). Voor elk token berekent de router scores en kiest de top-k experts (top-2 in Mixtral), waarbij het token alleen via deze wordt gerouteerd. Hun outputs worden gewogen en opgeteld. Omdat de meeste experts per token inactief blijven, bewaart het model veel parameters in het geheugen, maar voert het veel minder berekeningen uit. De wisselwerking: alle experts moeten in VRAM worden geladen, ook al draaien er maar enkele.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van mixtrale en schaarse modellen

Schaarse MoE staat nu centraal in frontier AI. Verwacht meer open MoE-releases, fijnmaziger routing met veel kleine experts en gedeelde of hybride expertontwerpen die de efficiëntie verder verbeteren. Naarmate modellen opschalen naar biljoenen totale parameters, is spaarzaamheid de belangrijkste hefboom om gevolgtrekkingen betaalbaar te houden. Onderzoek richt zich op het aanpakken van de zwakke plekken van MoE, het verdelen van de belasting over experts, geheugenoverhead en trainingsstabiliteit, terwijl hardware en serveerstacks steeds specifieker worden geoptimaliseerd voor routering door experts.

Implementatie in de echte wereld

Een hoogwaardige chatbot aanbieden tegen de kosten en snelheid van een veel kleiner compact model

Zelf-hosting van een Apache-2.0-gelicentieerd model voor commerciële producten zonder gebruikskosten

Het afstemmen van individueel gedrag op Mixtral voor coderen, samenvatten of meertalige taken

Snelle inferentie uitvoeren op een enkele multi-GPU-server waar een model met een dichtheid van 70 miljard te traag zou zijn

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model- en pijplijnparallellisme

Frequently asked questions

What is Mixtral and Sparse Models?

Mixtral is het open mix-of-experts-model van Mistral AI dat kwaliteit van grote modellen levert met de snelheid van kleine modellen. Schaarse modellen zoals deze activeren slechts een fractie van hun parameters per token, waardoor de rekenkracht wordt verminderd zonder dat dit ten koste gaat van de mogelijkheden.

Hoeveel experts verwerken in Mixtral 8x7B elk individueel token?

Mixtral maakt gebruik van top-2 routing: een router selecteert twee van de acht experts om elk token te verwerken.

Welk onderdeel bepaalt naar welke experts een token wordt gestuurd?

Een klein poortnetwerk, de router genaamd, beoordeelt de experts en selecteert welke met elk token omgaan.

Hoewel Mixtral 8x7B in totaal ongeveer 47 miljard parameters heeft, hoeveel zijn er ongeveer per token actief?

Omdat er slechts twee experts per token draaien, zijn er grofweg 13 miljard parameters actief, waardoor het de snelheid heeft van een veel kleiner model.

Wat is een belangrijke afweging tussen schaarse MoE-modellen zoals Mixtral?

MoE bespaart rekenkracht per token, maar vereist nog steeds dat alle experts in VRAM worden vastgehouden, waardoor de geheugenbehoefte toeneemt.

Onder welke licentie heeft Mistral AI Mixtral uitgebracht, waardoor open adoptie werd gestimuleerd?

Mixtral werd uitgebracht onder de tolerante Apache 2.0-licentie, waardoor gratis commercieel gebruik en verfijning mogelijk was.