Спекулятивне декодування чорнових моделей
Спекулятивне декодування використовує невелику швидку «чорнову» модель для вгадування кількох майбутніх токенів, які потім велика модель перевіряє за один прохід.
Огляд
It speeds up text generation 2-3x with no change to the output.
Глибоке занурення
Великі мовні моделі генерують текст по одному токену за раз, і кожен крок вимагає повного прямого проходу через мільярди параметрів — повільних і обмежених пам’яттю. Спекулятивне декодування атакує це шляхом поєднання великої «цільової» моделі з дешевою «чорновою» моделлю. Проект моделі швидко пропонує фрагмент із, скажімо, 4-8 токенів-кандидатів. Потім велика модель обробляє їх усі за один паралельний прохід вперед і перевіряє кожен. Приймаються токени, які відповідають тому, що створила б велика модель; перша невідповідність виправляється, а решта відкидаються. Оскільки перевірка кількох токенів одночасно коштує приблизно стільки ж, скільки й генерація одного, прийняті прогони майже безкоштовні. Важливо те, що етап відхилення вибірки гарантує, що кінцевий розподіл буде ідентичним до запуску великої моделі окремо — швидкість без втрати якості.
Технічне розуміння
Ключовий трюк полягає в модифікованому тесті на відбір проб. Для кожного чорнового токена ймовірність цільової моделі порівнюється з чорновою моделлю. Якщо мета призначає рівну або вищу ймовірність, маркер приймається; в іншому випадку він приймається з імовірністю, що дорівнює відношенню, і після відхилення виправлений маркер вибирається зі скоригованого розподілу залишків. Ця математика робить результат доказово еквівалентним вибірці безпосередньо з великої моделі.
Стратегічний вплив
Швидкість і масштаб
Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.
Доступ і охоплення
Це розширює доступ до різних мов і стилів спілкування.
Чіткіші рішення
Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.
Майбутнє спекулятивного декодування чорнових моделей
Очікуйте, що чорнові моделі стануть стандартною інфраструктурою в серверах висновків, таких як vLLM і TensorRT-LLM. Варіанти самостійної спекуляції (Medusa, EAGLE) повністю відмовляються від окремої чорнової моделі, додаючи полегшені головки прогнозів, а креслення на основі дерева перевіряє багато продовжень кандидатів одночасно. У міру того, як вікна контексту зростають, а витрати на обслуговування домінують, розумніші розробники, що відповідають моделі, і перевірка з урахуванням апаратного забезпечення підвищать рівень прийняття та пропускну здатність.
Реалізація в реальному світі
Anthropic, OpenAI та Google використовують спекулятивне декодування, щоб зменшити затримку та витрати на обслуговування помічників чату, які обслуговують мільйони користувачів.
vLLM і NVIDIA TensorRT-LLM містять вбудоване спекулятивне декодування, щоб самостійні хостери могли пришвидшити розгортання Llama або Mistral.
Поєднання чорнової моделі 7B із цільовою метою 70B (наприклад, сімейство Llama-3), щоб приблизно подвоїти кількість токенів за секунду на одному GPU.
Інструменти завершення коду використовують крихітну чорнову модель, щоб запропонувати шаблон, який більша модель перевіряє, зберігаючи миттєві пропозиції в редакторі.
Ризики та огорожі
Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.
Делікатність підказок може створити суперечливі результати для подібних запитів.
Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.
Дорожня карта впровадження
Визначте вихідний формат, тон і стандарти якості перед розгортанням.
Якщо точність має значення, зв’яжіться з надійними джерелами.
Тримайте контрольну точку перевірки людьми для отримання високих ставок.
Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Спекулятивні редагування для моделей коду
Часті запитання
What is Speculative Decoding Draft Models?
Спекулятивне декодування використовує невелику швидку «чорнову» модель для вгадування кількох майбутніх токенів, які потім велика модель перевіряє за один прохід. Це пришвидшує генерацію тексту в 2-3 рази без жодних змін у виводі.
Яка основна роль «чорнової» моделі в спекулятивному декодуванні?
Мала чернеткова модель дешево вгадує майбутні токени, які велика цільова модель потім перевіряє за один паралельний прохід.
Чому одночасна перевірка кількох створених токенів економить час?
Генерація пов'язана з пам'яттю; перевірка кількох токенів за один груповий прохід коштує майже так само дешево, як один крок, тому прийняті прогони майже безкоштовні.
Що відбувається з чорновими токенами після першого токена, відхиленого цільовою моделлю?
Прийняття триває до першої розбіжності; цей маркер виправляється, а всі наступні складені маркери викидаються.
Як спекулятивне декодування забезпечує відсутність погіршення якості виведення?
Модифікований тест відхилення вибірки гарантує, що кінцевий розподіл токенів відповідає вибірці безпосередньо з цільової моделі.
Що з цього є підходом «самоспекуляції», який уникає окремого проекту моделі?
Medusa та EAGLE додають легкі додаткові головки прогнозування до основної моделі, щоб вона могла створювати власні майбутні токени.