РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Предварительные модели спекулятивного декодирования

Спекулятивное декодирование использует небольшую, быструю «черновую» модель для угадывания нескольких предстоящих токенов, которые затем проверяет большая модель за один проход.

2 минуты чтенияПоследнее обновление

Обзор

It speeds up text generation 2-3x with no change to the output.

Глубокое погружение

Большие языковые модели генерируют текст по одному токену за раз, и каждый шаг требует полного прямого прохода через миллиарды параметров — медленно и с привязкой к памяти. Спекулятивное декодирование решает эту проблему, объединяя большую «целевую» модель с дешевой «черновой» моделью. Проект модели быстро предлагает часть, скажем, 4-8 токенов-кандидатов. Затем большая модель обрабатывает их все за один параллельный проход и проверяет каждый. Принимаются токены, соответствующие тому, что могла бы произвести большая модель; первое несоответствие исправляется, а остальные отбрасываются. Поскольку одновременная проверка нескольких токенов стоит примерно столько же, сколько генерация одного, принятые запуски практически бесплатны. Важно отметить, что этап отбраковки выборки гарантирует, что окончательное распределение идентично запуску только большой модели — скорость без потери качества.

Техническая информация

Ключевой трюк — модифицированный тест отбраковки. Для каждого составленного токена вероятность целевой модели сравнивается с вероятностью черновой модели. Если цель назначает равную или более высокую вероятность, токен принимается; в противном случае он принимается с вероятностью, равной отношению, а при отклонении исправленный токен выбирается из скорректированного остаточного распределения. Эта математика делает результат доказуемо эквивалентным выборке непосредственно из большой модели.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее черновых моделей спекулятивного декодирования

Ожидайте, что черновые модели станут стандартной инфраструктурой серверов вывода, таких как vLLM и TensorRT-LLM. Варианты самопредположения (Medusa, EAGLE) полностью исключают отдельную черновую модель за счет добавления облегченных прогнозных головок, а составление на основе дерева проверяет сразу множество возможных продолжений. Поскольку контекстные окна растут, а стоимость обслуживания доминирует, более умные, согласованные с моделями составители документов и верификация с учетом аппаратного обеспечения будут способствовать повышению скорости принятия и пропускной способности.

Реальная реализация

Anthropic, OpenAI и Google используют спекулятивное декодирование, чтобы сократить задержку и стоимость обслуживания чат-помощников, обслуживающих миллионы пользователей.

vLLM и NVIDIA TensorRT-LLM оснащены встроенным спекулятивным декодированием, поэтому владельцы самостоятельного хостинга могут ускорить развертывание Llama или Mistral.

Сопряжение черновой модели 7B с целевой моделью 70B (например, семейством Llama-3) для примерно удвоения количества токенов в секунду на одном графическом процессоре.

Инструменты завершения кода используют крошечную черновую модель для предложения шаблона, который проверяется более крупной моделью, сохраняя при этом предложения в редакторе.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Спекулятивные изменения моделей кода

Часто задаваемые вопросы

What is Speculative Decoding Draft Models?

Спекулятивное декодирование использует небольшую, быструю «черновую» модель для угадывания нескольких предстоящих токенов, которые затем проверяет большая модель за один проход. Это ускоряет генерацию текста в 2-3 раза без каких-либо изменений в выводе.

Какова основная роль «черновой» модели в спекулятивном декодировании?

Небольшая черновая модель дешево угадывает предстоящие токены, которые затем проверяет большая целевая модель за один параллельный проход.

Почему одновременная проверка нескольких созданных токенов экономит время?

Генерация привязана к памяти; проверка нескольких токенов за один пакетный проход почти так же дешева, как и один шаг, поэтому принятые прогоны почти бесплатны.

Что происходит с составленными токенами после того, как целевая модель отклоняет первый токен?

Принятие продолжается до первого несогласия; этот жетон исправляется, а все последующие составленные жетоны выбрасываются.

Как спекулятивное декодирование гарантирует, что качество вывода не ухудшится?

Модифицированный тест отбраковки выборки гарантирует, что окончательное распределение токенов соответствует выборке непосредственно из целевой модели.

Какой из этих подходов является «самоспекуляцией», избегающим разработки отдельного проекта модели?

Medusa и EAGLE добавляют к основной модели легкие дополнительные прогнозирующие головки, чтобы она могла создавать свои собственные будущие токены.