Mengsel van diepten
Met Mixture of Depths (MoD) kan een transformator verschillende hoeveelheden rekenkracht besteden aan verschillende tokens, waarbij alleen de 'belangrijke' tokens door de zware berekeningen van elke laag worden geleid.
Overzicht
It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.
Diepe duik
Standaardtransformatoren passen elke laag op elk token toe, zelfs triviale zoals interpunctie. Mixture of Depths, geïntroduceerd door Google DeepMind in 2024, voegt een kleine router toe aan elk blok die een vaste top-k-fractie van tokens selecteert om de volledige zelfaandacht en MLP-berekening te ondergaan; de rest slaat het blok over via een restverbinding. Omdat er slechts k tokens per laag worden verwerkt, is de totale rekenkracht (FLOP's) van tevoren beperkt en bekend, in tegenstelling tot eerdere methoden met dynamische diepte die onvoorspelbaar varieerden. Dit maakt batching en hardwaregebruik efficiënt. Door MoD getrainde modellen kunnen de kwaliteit van een basistransformator evenaren met minder FLOP's per voorwaartse doorgang, of een hogere kwaliteit bereiken met dezelfde rekenkracht, en het idee ontstaat op natuurlijke wijze met Mixture-of-Experts om 'MoDE'-modellen te geven die zowel op diepte als breedte routeren.
Technisch inzicht
Bij elk MoD-blok scoort een geleerde lineaire router elk token en houdt de top-k bij op score; geselecteerde tokens passeren de aandacht en de MLP, terwijl niet-geselecteerde tokens onveranderd worden overgedragen via het resterende pad. Door een vaste top-k te gebruiken (in plaats van een drempelwaarde per token) wordt de rekengrafiek statisch en worden de tensorvormen constant, wat hardwarevriendelijk is. De router wordt getraind met de rest van het netwerk, en causale generatie maakt gebruik van hulpvoorspellers, zodat routeringsbeslissingen niet naar toekomstige tokens kijken.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van een mix van diepten
Voorwaardelijke berekening is een belangrijke hefboom voor efficiëntie naarmate modellen opschalen, en MoD is een vroeg, schoon voorbeeld. Verwacht een diepere integratie met Mixture-of-Experts (routing op zowel diepte als experts), adaptieve budgetten die kleiner worden voor gemakkelijke invoer, en geleerde routers die beter identificeren welke tokens echt diepgaande verwerking nodig hebben. Omdat inferentiekosten de implementatie-economie domineren, zullen technieken die modellen alleen 'harder laten nadenken' waar dat nodig is, terwijl de voorspelbare latentie behouden blijft, waarschijnlijk standaard worden in grootschalige architecturen.
Implementatie in de echte wereld
Het verminderen van de FLOP's die nodig zijn om lange documenten te verwerken door diepgaande berekeningen op opvultokens over te slaan
Train een model dat overeenkomt met de basiskwaliteit bij een lagere rekenkracht, waardoor de servicekosten lager zijn
Combineren met Mixture-of-Experts (MoDE) om te routeren op zowel laagdiepte als expertkeuze
Het behouden van een voorspelbare, vaste latentie per token, omdat het rekenbudget per laag vooraf wordt vastgesteld
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Depths quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Aggregatie van mengsels van agenten
Frequently asked questions
What is Mixture of Depths?
Met Mixture of Depths (MoD) kan een transformator verschillende hoeveelheden rekenkracht besteden aan verschillende tokens, waarbij alleen de 'belangrijke' tokens door de zware berekeningen van elke laag worden geleid. Het verlaagt de kosten voor het verwerken van eenvoudige tokens, terwijl een vast, voorspelbaar computerbudget behouden blijft.
Wat varieert het mengsel van diepten per token?
MoD stuurt slechts enkele tokens door de zware berekeningen van elke laag, zodat verschillende tokens effectief verschillende diepte krijgen.
Hoe houdt Defensie zijn rekenbudget voorspelbaar?
Door een vaste top-k aan tokens per blok te kiezen, worden FLOP's beperkt en worden de tensorvormen constant gehouden, wat hardwarevriendelijk is.
Wat gebeurt er met tokens die de router NIET selecteert bij een bepaald blok?
Niet-geselecteerde tokens omzeilen de berekening van het blok en worden onveranderd overgedragen via het resterende pad.
Wie introduceerde het mengsel van diepten?
Mixture of Depths werd geïntroduceerd door Google DeepMind in een paper uit 2024 over dynamische transformatorcomputers.
Wat levert het combineren van Defensie met een mix van deskundigen op?
Het combineren van diepterouting met expertrouting levert 'MoDE'-modellen op die de berekeningen op zowel lagen als experts conditioneren.