Voorspellingstraining met meerdere tokens
In plaats van alleen het volgende token te voorspellen, wordt het model getraind om meerdere toekomstige tokens tegelijk te voorspellen.
Overzicht
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Diepe duik
Standaardtaalmodellen worden getraind met next-token-voorspelling: voorspel, gegeven een context, het volgende token. Multi-token voorspelling (MTP), gepopulariseerd door een Meta paper uit 2024 en overgenomen in DeepSeek-V3, voegt extra lichtgewicht uitvoerkoppen toe, zodat het model tegelijkertijd het volgende token voorspelt plus de 2e, 3e en 4e tokens die uit dezelfde verborgen staat komen. Dit dwingt het netwerk om verder in de toekomst te plannen en verdicht het trainingssignaal: elke positie draagt nu bij aan meerdere verliestermen. Meta rapporteerde vooral grote winsten op het gebied van coderen en generatief redeneren, waarbij grotere modellen er meer van profiteerden. Cruciaal is dat de extra koppen na de training kunnen worden weggegooid, zodat de modelgrootte bij inzet niet hoeft te groeien.
Technisch inzicht
MTP bevestigt n onafhankelijke voorspellingskoppen bovenop de gedeelde transformatorstam; hoofd k voorspelt het token op positie t+k op basis van de representatie op positie t. De verliezen worden tijdens de training bij elkaar opgeteld. Concluderend maken de hulpkoppen zelfspeculatieve decodering mogelijk: het model stelt meerdere tokens in één keer voor en verifieert ze vervolgens, waardoor tot ongeveer 3x snellere generatie wordt bereikt zonder de uitvoerverdeling te veranderen.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van multi-token voorspellingstraining
MTP wordt een standaardingrediënt in recepten voor grenstrainingen, omdat het tegen lage kosten zowel de kwaliteit als de inferentiesnelheid verbetert. Verwacht een nauwere integratie met speculatieve decodering, diepere voorspellingshorizonten en gebruik als hulpdoel dat de planning over de lange horizon verbetert. Gecombineerd met redeneermodellen kan het voorspellen van meerdere stappen vooruit modellen helpen de consequenties intern te simuleren voordat ze zich tot een antwoord wenden.
Implementatie in de echte wereld
DeepSeek-V3 gebruikt een MTP-doelstelling tijdens de voortraining om de gegevensefficiëntie te vergroten en speculatieve decodering mogelijk te maken
De codegeneratiemodellen van Meta tonen nauwkeurigheidswinsten op HumanEval en MBPP door het voorspellen van meerdere tokens
Zelfspeculatieve decodering: 3-4 tokens per voorwaartse doorgang opstellen en vervolgens verifiëren voor snellere, distributiebehoudende uitvoer
Snellere automatische aanvulling in codeerassistenten waarbij meerdere plausibele tokens in één stap worden voorgesteld en gecontroleerd
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Speculatieve streaming en voorspelling van meerdere tokens
Frequently asked questions
What is Multi-Token Prediction Training?
In plaats van alleen het volgende token te voorspellen, wordt het model getraind om meerdere toekomstige tokens tegelijk te voorspellen. Dit scherpt de leersignalen aan en maakt snellere gevolgtrekkingen mogelijk via zelfspeculatieve decodering.
Wat voegt multi-token voorspelling toe vergeleken met standaard next-token training?
MTP voegt extra uitvoerkoppen toe, zodat het model het volgende token voorspelt, plus verschillende tokens verder weg van een verborgen status.
Welk model maakte met name gebruik van een multi-token voorspellingsdoelstelling bij de voortraining?
DeepSeek-V3 heeft een MTP-trainingsdoel aangenomen om de gegevensefficiëntie te verbeteren en speculatieve decodering mogelijk te maken.
Waarom verdicht MTP het trainingssignaal?
Het voorspellen van meerdere toekomstige tokens betekent dat elke tokenpositie verschillende voorspellingsverliezen produceert, waardoor er meer leersignalen per token ontstaan.
Welk gevolgtrekkingsvoordeel maken de extra voorspellingskoppen mogelijk?
De hulpkoppen kunnen per doorgang meerdere tokens opstellen die vervolgens worden geverifieerd, waardoor het genereren wordt versneld zonder de uitvoerverdeling te veranderen.
Wat gebeurt er met de hulpkoppen na de training als je geen versnellingen nodig hebt?
De extra koppen zijn optioneel bij inzet; Als u ze weggooit, blijft het model even groot als een standaard next-token-model.