GHID AI limbaj

Antrenament de predicție multi-token

În loc să prezică doar următorul token, modelul este antrenat să prezică mai multe jetonuri viitoare simultan.

2 minute de lecturăUltima actualizare

Prezentare generală

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

Scufundare în profunzime

Modelele de limbaj standard sunt antrenate cu predicția următorului simbol: dat fiind un context, preziceți un singur simbol următor. Predicția multitoken (MTP), popularizată de o lucrare Meta din 2024 și adoptată în DeepSeek-V3, adaugă capete de ieșire ușoare, astfel încât modelul prezice simultan următorul jeton plus al 2-lea, al 3-lea și al 4-lea jeton înainte din aceeași stare ascunsă. Acest lucru forțează rețeaua să planifice mai departe în viitor și densifică semnalul de antrenament - fiecare poziție contribuie acum cu mai mulți termeni de pierdere. Meta a raportat câștiguri deosebit de mari în ceea ce privește codificarea și raționamentul generativ, modelele mai mari beneficiind mai mult. În mod crucial, capetele suplimentare pot fi aruncate după antrenament, astfel încât dimensiunea modelului la implementare nu trebuie să crească.

Perspectivă tehnică

MTP atașează n capete de predicție independente peste trunchiul transformatorului comun; capul k prezice jetonul în poziţia t+k din reprezentarea în poziţia t. Pierderile se însumează în timpul antrenamentului. La deducere, capetele auxiliare permit decodificarea auto-speculative: modelul propune mai multe jetoane într-o singură trecere, apoi le verifică, realizând o generare de până la 3 ori mai rapidă, fără a modifica distribuția de ieșire.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul antrenamentului de predicție multi-token

MTP devine un ingredient implicit în rețetele de antrenament de frontieră, deoarece îmbunătățește atât calitatea, cât și viteza de inferență la un cost mic. Așteptați-vă la o integrare mai strânsă cu decodificarea speculativă, orizonturi de predicție mai profunde și utilizarea ca obiectiv auxiliar care îmbunătățește planificarea pe orizont lung. Combinată cu modele de raționament, prezicerea mai multor pași înainte poate ajuta modelele să simuleze intern consecințele înainte de a se angaja la un răspuns.

Implementare în lumea reală

DeepSeek-V3 utilizând un obiectiv MTP în timpul antrenamentului pentru a crește eficiența datelor și a permite decodificarea speculativă

Modelele de generare de cod ale lui Meta care arată câștiguri de precizie pe HumanEval și MBPP din prezicerea mai multor jetoane

Decodificare auto-speculative: redactarea a 3-4 jetoane per trecere înainte apoi verificarea pentru o ieșire mai rapidă, care păstrează distribuția

Completare automată mai rapidă în asistenții de codare, unde sunt propuse și verificate mai multe jetoane plauzibile într-un singur pas

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Streaming speculativ și predicție multi-token

Întrebări frecvente

What is Multi-Token Prediction Training?

În loc să prezică doar următorul token, modelul este antrenat să prezică mai multe jetonuri viitoare simultan. Acest lucru accentuează semnalele de învățare și deblochează o inferență mai rapidă prin decodare auto-speculative.

Ce adaugă predicția multi-token în comparație cu antrenamentul standard următor?

MTP adaugă capete de ieșire suplimentare, astfel încât modelul prezice următorul token plus mai multe jetonuri mai departe de o stare ascunsă.

Care model a folosit în special un obiectiv de predicție multi-token în preinstruire?

DeepSeek-V3 a adoptat un obiectiv de instruire MTP pentru a îmbunătăți eficiența datelor și a permite decodificarea speculativă.

De ce MTP densifică semnalul de antrenament?

Prezicerea mai multor jetoane viitoare înseamnă că fiecare poziție de jetoane produce mai multe pierderi de predicție, oferind mai mult semnal de învățare per jeton.

Ce beneficii de inferență permit capetele de predicție suplimentare?

Capetele auxiliare pot elabora mai multe jetoane per trecere care sunt apoi verificate, accelerând generarea fără a modifica distribuția de ieșire.

Ce se întâmplă cu șefii auxiliari după antrenament dacă nu ai nevoie de accelerații?

Capetele suplimentare sunt opționale la desfășurare; aruncarea lor păstrează modelul la aceeași dimensiune ca un model standard de următor.