推测性解码草案模型
推测性解码使用小型、快速的“草稿”模型来猜测几个即将出现的标记,然后大型模型一次性验证这些标记。
概述
It speeds up text generation 2-3x with no change to the output.
深入探讨
大型语言模型一次生成一个标记的文本,每一步都需要完全前向传递数十亿个参数——速度慢且受内存限制。推测性解码通过将大的“目标”模型与廉价的“草稿”模型配对来解决这个问题。模型草案快速提出了一大块,例如 4-8 个候选令牌。然后,大模型在一次并行前向传递中处理所有这些,并检查每一个。接受与大模型生成的代币相匹配的代币;第一个不匹配被纠正,其余的被丢弃。由于一次验证多个代币的成本与生成一个代币的成本大致相同,因此接受的运行几乎是免费的。至关重要的是,拒绝采样步骤可确保最终分布与单独运行大模型相同 - 速度快且质量没有损失。
技术洞察
关键技巧是改进的拒绝抽样测试。对于每个起草的令牌,目标模型的概率与草案模型的概率进行比较。如果目标分配相同或更高的概率,则令牌被接受;否则,它以等于该比率的概率被接受,并且在拒绝时,从调整后的残差分布中采样校正的令牌。这种数学计算使得输出可证明相当于直接从大型模型中采样。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
推测性解码草案模型的未来
预计草案模型将成为 vLLM 和 TensorRT-LLM 等推理服务器的标准基础设施。自我推测变体(Medusa、EAGLE)通过添加轻量级预测头完全放弃了单独的草稿模型,并且基于树的草稿同时验证了许多候选延续。随着上下文窗口的增长和服务成本的主导,更智能、模型匹配的绘图员和硬件感知验证将提高接受率和吞吐量。
现实世界的实施
Anthropic、OpenAI 和 Google 使用推测解码来减少为数百万用户提供服务的聊天助手的延迟和服务成本。
vLLM 和 NVIDIA TensorRT-LLM 附带内置推测解码,因此自托管程序可以加速 Llama 或 Mistral 部署。
将 7B 草稿模型与 70B 目标(例如 Llama-3 系列)配对,可在单个 GPU 上将每秒令牌数大约增加一倍。
代码完成工具使用一个微小的草稿模型来提出由较大模型验证的样板,从而使建议在编辑器中保持敏捷。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Speculative Decoding Draft Models?
推测性解码使用小型、快速的“草稿”模型来猜测几个即将出现的标记,然后大型模型一次性验证这些标记。它可以在不改变输出的情况下将文本生成速度提高 2-3 倍。
“草案”模型在推测解码中的主要作用是什么?
小草稿模型可以廉价地猜测即将到来的令牌,然后大型目标模型在单个并行传递中检查这些令牌。
为什么一次验证多个起草的令牌可以节省时间?
世代是受记忆限制的;在一次批量传递中检查多个令牌几乎与一步一样便宜,因此接受的运行几乎是免费的。
在目标模型拒绝第一个令牌之后,起草的令牌会发生什么?
接受一直持续到第一次出现分歧为止;该令牌被更正,并且所有后续起草的令牌都被丢弃。
推测解码如何确保输出质量不降低?
修改后的拒绝采样测试保证最终的令牌分布与直接从目标模型采样相匹配。
其中哪一个是避免单独草案模型的“自我推测”方法?
Medusa 和 EAGLE 在主模型中添加了轻量级的额外预测头,以便它可以起草自己的未来代币。