Навчання мультитокенному прогнозуванню
Замість того, щоб передбачати лише наступний токен, модель навчена передбачати кілька майбутніх токенів одночасно.
Огляд
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Глибоке занурення
Стандартні мовні моделі навчаються з передбаченням наступного токена: враховуючи контекст, передбачити єдиний наступний токен. Багатотокенне прогнозування (MTP), популяризоване в документі Meta 2024 року та прийняте в DeepSeek-V3, додає додаткові полегшені вихідні головки, щоб модель одночасно прогнозувала наступний маркер, а також 2-й, 3-й і 4-й токени попереду з того самого прихованого стану. Це змушує мережу планувати далі в майбутнє та згущує навчальний сигнал — кожна позиція тепер вносить численні втрати. Meta повідомив про особливо великі успіхи в кодуванні та генеративному міркуванні, причому більші моделі отримали більше переваг. Важливо те, що зайві голови можна викинути після навчання, тому розмір моделі під час розгортання не повинен збільшуватися.
Технічне розуміння
MTP прикріплює n незалежних головок прогнозування на верхній частині спільної магістралі трансформатора; head k передбачає маркер у позиції t+k із представлення в позиції t. Втрати підсумовуються під час навчання. Під час висновку допоміжні головки дозволяють самостійно спекулятивне декодування: модель пропонує кілька маркерів за один прохід, а потім перевіряє їх, досягаючи приблизно в 3 рази швидшої генерації без зміни розподілу вихідних даних.
Стратегічний вплив
Швидкість і масштаб
Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.
Доступ і охоплення
Це розширює доступ до різних мов і стилів спілкування.
Чіткіші рішення
Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.
Майбутнє навчання багатотокенному прогнозуванню
MTP стає стандартним інгредієнтом у рецептах передового навчання, оскільки він покращує як якість, так і швидкість висновку за невеликі витрати. Очікуйте тіснішої інтеграції з спекулятивним декодуванням, глибшими горизонтами прогнозування та використанням як допоміжної цілі, що покращує довгострокове планування. У поєднанні з моделями міркувань прогнозування кількох кроків наперед може допомогти моделям внутрішньо моделювати наслідки, перш ніж приступити до відповіді.
Реалізація в реальному світі
DeepSeek-V3 використовує ціль MTP під час попереднього навчання для підвищення ефективності даних і увімкнення спекулятивного декодування
Моделі генерації коду Meta, які демонструють підвищення точності HumanEval і MBPP завдяки прогнозуванню кількох токенів
Самостійне спекулятивне декодування: створення 3-4 токенів на прохід вперед, а потім перевірка для швидшого виведення, що зберігає розподіл
Швидше автозаповнення в помічниках кодування, де кілька правдоподібних токенів пропонуються та перевіряються за один крок
Ризики та огорожі
Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.
Делікатність підказок може створити суперечливі результати для подібних запитів.
Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.
Дорожня карта впровадження
Визначте вихідний формат, тон і стандарти якості перед розгортанням.
Якщо точність має значення, зв’яжіться з надійними джерелами.
Тримайте контрольну точку перевірки людьми для отримання високих ставок.
Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Спекулятивне потокове передавання та прогнозування кількох токенів
Часті запитання
What is Multi-Token Prediction Training?
Замість того, щоб передбачати лише наступний токен, модель навчена передбачати кілька майбутніх токенів одночасно. Це посилює навчальні сигнали та відкриває швидший висновок за допомогою самостійного спекулятивного декодування.
Що додає передбачення з кількома маркерами порівняно зі стандартним навчанням із наступним маркером?
MTP додає додаткові головки виводу, щоб модель передбачала наступний маркер плюс кілька маркерів далі з одного прихованого стану.
Яка модель, зокрема, використовувала мету передбачення з кількома маркерами під час попереднього навчання?
DeepSeek-V3 застосував навчальну мету MTP для підвищення ефективності даних і уможливлення спекулятивного декодування.
Чому MTP ущільнює навчальний сигнал?
Прогнозування кількох майбутніх токенів означає, що кожна позиція токена призводить до кількох прогнозованих втрат, що дає більше сигналу навчання на токен.
Які переваги висновків дають додаткові головки прогнозування?
Допоміжні головки можуть створювати кілька токенів за прохід, які потім перевіряються, прискорюючи генерацію без зміни розподілу вихідних даних.
Що буде з допоміжними головками після тренування, якщо не потрібні прискорення?
Додаткові головки є необов’язковими під час розгортання; відкинувши їх, модель зберігає той самий розмір, що й стандартна модель наступного маркера.