Обучение за прогнозиране на множество токени
Вместо да предвижда само следващия токен, моделът е обучен да предвижда няколко бъдещи токена наведнъж.
Преглед
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Дълбоко гмуркане
Стандартните езикови модели се обучават с предсказване на следващ токен: при даден контекст, предсказване на единичния следващ токен. Multi-token prediction (MTP), популяризирано от 2024 Meta документ и прието в DeepSeek-V3, добавя допълнителни олекотени изходни глави, така че моделът едновременно да прогнозира следващия токен плюс 2-ри, 3-ти и 4-ти токени напред от същото скрито състояние. Това принуждава мрежата да планира по-нататък в бъдещето и уплътнява тренировъчния сигнал - всяка позиция сега допринася за множество загуби. Meta отчете особено големи печалби при кодирането и генеративното мислене, като по-големите модели се възползват повече. Най-важното е, че допълнителните глави могат да бъдат изхвърлени след обучение, така че размерът на модела при внедряване не трябва да нараства.
Техническа информация
MTP прикрепя n независими глави за прогнозиране върху споделения ствол на трансформатора; head k предсказва токена на позиция t+k от представянето на позиция t. Загубите се сумират по време на тренировка. При извод спомагателните глави позволяват самоспекулативно декодиране: моделът предлага няколко токена в едно преминаване, след което ги проверява, постигайки до приблизително 3 пъти по-бързо генериране, без да променя изходното разпределение.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на обучението за прогнозиране на множество токени
MTP се превръща в съставка по подразбиране в рецептите за гранично обучение, защото подобрява както качеството, така и скоростта на извод на ниска цена. Очаквайте по-тясна интеграция със спекулативно декодиране, по-дълбоки хоризонти на прогнозиране и използване като спомагателна цел, която подобрява дългосрочното планиране. В комбинация с модели на разсъждения, предвиждането на множество стъпки напред може да помогне на моделите да симулират вътрешно последствия, преди да се ангажират с отговор.
Внедряване в реалния свят
DeepSeek-V3 използва MTP цел по време на предварително обучение за повишаване на ефективността на данните и активиране на спекулативно декодиране
Моделите за генериране на код на Meta, показващи повишаване на точността на HumanEval и MBPP от прогнозиране на множество токени
Самоспекулативно декодиране: съставяне на 3-4 токена на предно преминаване, след което проверка за по-бърз изход, запазващ разпространението
По-бързо автоматично довършване в асистентите за кодиране, където се предлагат множество правдоподобни токени и се проверяват в една стъпка
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Спекулативно поточно предаване и прогнозиране на множество токени
Frequently asked questions
What is Multi-Token Prediction Training?
Вместо да предсказва само следващия токен, моделът е обучен да предсказва няколко бъдещи токена наведнъж. Това изостря сигналите за обучение и отключва по-бързи изводи чрез самоспекулативно декодиране.
Какво добавя предвиждането на множество токени в сравнение със стандартното обучение за следващ токен?
MTP добавя допълнителни изходни глави, така че моделът предвижда следващия токен плюс няколко токена по-напред от едно скрито състояние.
Кой модел по-специално използва цел за прогнозиране на множество токени в предварителното обучение?
DeepSeek-V3 прие цел за MTP обучение, за да подобри ефективността на данните и да даде възможност за спекулативно декодиране.
Защо MTP уплътнява тренировъчния сигнал?
Прогнозирането на няколко бъдещи токена означава, че всяка позиция на токена води до няколко загуби при прогнозиране, което дава повече сигнал за обучение на токен.
Каква полза от изводите позволяват допълнителните глави за прогнозиране?
Спомагателните глави могат да изготвят множество жетони на преминаване, които след това се проверяват, ускорявайки генерирането, без да променят изходното разпределение.
Какво се случва с помощните глави след тренировка, ако нямате нужда от ускорения?
Допълнителните глави не са задължителни при разгръщане; изхвърлянето им запазва модела със същия размер като стандартен модел със следващ токен.