推测性解码
推测性解码通过使用小型、快速的“草稿”模型提前猜测多个标记,然后让大型模型立即验证它们,从而使大型语言模型更快地生成文本。
概述
It speeds up inference 2-3x with identical output quality.
深入探讨
通常,LLM 一次生成一个标记的文本:每个标记都需要通过巨型模型进行完整的前向传递,并且在当前标记完成之前您无法开始下一个标记。这很慢,因为它受内存限制,而不是计算限制——GPU 大部分时间都花在加载权重上,而不是做数学运算。推测性解码打破了瓶颈。一个小型、廉价的草案模型提出了一大块,例如五个候选令牌。然后,大型“目标”模型在一次并行前向传递中处理所有五个并检查它们。与其产生的代币相匹配的代币被接受;当出现第一个分歧时,它会纠正并丢弃其余的。由于验证许多代币的成本与生成一个代币的成本大致相同,因此接受的猜测几乎是免费的。
技术洞察
巧妙的部分是拒绝采样规则,它保证输出分布在数学上与单独运行目标模型相同 - 因此质量不是近似的,而是精确的。接受率推动加速:小模型对大模型的预测越好,每个验证步骤中保留的代币就越多。 Medusa 等变体为目标模型本身添加了额外的预测头,而 EAGLE 在特征空间中草稿,从而无需单独的草稿模型。
战略影响
成本与预算
多年来,架构决策决定着性能和运营成本。
更清晰的判决
技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。
质量控制
更好的工程选择可以减少生产中的可靠性事故。
推测解码的未来
推测性解码正在成为 vLLM 和 TensorRT-LLM 等服务堆栈中的默认设置。预计自起草方法(Medusa、EAGLE、Lookahead)将占主导地位,因为它们避免维护第二个模型,加上基于树的推测,每一步验证多个候选分支。随着模型的增长,内存限制的瓶颈变得更加严重,这使得猜测变得更加有价值,并且具有硬件意识的绘图人员将推动现实世界的加速。
现实世界的实施
7B 草案模型提出 70B 聊天模型的代币,以减少生产助理中的响应延迟
Medusa 头固定在 LLM 上,因此无需单独的草稿模型即可同时预测多个未来代币
vLLM 支持推测性解码,以提高服务集群上的每秒令牌吞吐量
在模型的隐藏特征空间中进行 EAGLE 绘图,以提高接受率和整体速度
风险与防护栏
优化一项基准测试可以隐藏更广泛的系统弱点。
基础设施和维护成本常常被低估。
随着系统变得更加复杂,安全性和可观察性差距可能会扩大。
实施路线图
在实施之前定义延迟、质量和成本目标。
在实际负载和数据条件下进行基准测试。
仪器监控错误、漂移和用户影响。
在扩展之前准备回滚和事件响应路径。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Speculative Decoding?
推测性解码通过使用小型、快速的“草稿”模型提前猜测多个标记,然后让大型模型立即验证它们,从而使大型语言模型更快地生成文本。它以相同的输出质量将推理速度提高 2-3 倍。
推测解码的核心思想是什么?
快速草稿模型提出多个令牌,大型目标模型在一次并行传递中检查所有令牌。
为什么正常的一次生成一个令牌的 LLM 生成速度很慢?
每个步骤主要从内存加载巨大的权重矩阵,而不是进行大量计算,因此 GPU 没有得到充分利用。
当草案和目标模型不一致的第一个标记时会发生什么?
接受不超过分歧的代币;从不匹配开始,它们将被拒绝,并保留目标模型的正确标记。
推测解码如何影响输出质量?
拒绝抽样规则保证最终分布与目标模型完全匹配,因此质量不变。
最直接决定推测解码加速的因素是什么?
目标模型每个验证步骤接受的起草令牌越多,加速就越大。