推测性抽样验证
推测采样通过让小型“草稿”模型提前猜测多个标记,然后让大型模型一次性验证它们,从而加速大型语言模型的生成。
概述
The clever verification step guarantees the output matches what the big model would have produced on its own.
深入探讨
自回归生成速度很慢,因为每个令牌都需要一个巨大模型的完整前向传递。推测抽样通过将廉价的草稿模型与昂贵的目标模型配对来解决这个问题。该草案提议短期发行代币(例如 4-8 个);然后目标通过一次平行向前传球将所有球得分。修改后的拒绝采样规则接受与目标自身分布一致的最长前缀,并在第一个拒绝位置重新采样。因为接受是概率性的并且是经过校正的,所以最终的令牌流可以证明完全像目标单独生成一样分布,没有质量损失。当草稿快速且对齐良好时,典型的加速是 2-3 倍,因为每个昂贵的调用都会确认多个令牌。
技术洞察
对于每个起草的令牌,您可以比较目标概率 q 和起草概率 p。以概率 min(1, q/p) 接受;如果被拒绝,则从归一化残差分布 max(0, q-p) 中采样。此拒绝规则使边际分布与纯目标采样相同。目标的并行传递还会在最后接受的令牌之后“免费”生成下一个令牌分配,因此进度永远不会停止。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
推测性抽样验证的未来
推测性解码正在成为推理堆栈的标准。较新的变体放弃了单独的草稿模型:自我推测使用提前退出或额外的预测头(Medusa、EAGLE),基于树的草稿一次验证许多候选延续,前瞻解码并行化 n-gram 猜测。预计与批处理和 KV 缓存管理、硬件感知草稿大小的更紧密集成,以及在对延迟敏感的产品(如聊天助手和编码工具)中更广泛的使用,其中每一毫秒都很重要。
现实世界的实施
使用 7B 草稿模型提供 70B 聊天模型,可将响应延迟大约减少一半,同时输出质量相同。
美杜莎风格的头是用一个模型预测几个未来的代币,然后在没有单独的草案网络的情况下验证它们。
基于树的推测解码,提出多个分支延续并在一次目标传递中验证它们。
加速代码完成助手,其中草稿模型处理大型模型快速确认的可预测样板文件。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Sampling Verification quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Speculative Sampling Verification?
推测采样通过让小型“草稿”模型提前猜测多个标记,然后让大型模型一次性验证它们,从而加速大型语言模型的生成。巧妙的验证步骤保证了输出与大模型自己产生的结果相匹配。
推测性抽样背后的核心思想是什么?
廉价的草稿模型会提前猜测几个标记,而昂贵的目标模型会在一次并行前向传递中检查所有标记。
为什么推测抽样不会降低输出质量?
修改后的拒绝采样校正保证了接受的令牌的分布与目标模型单独生成的完全一样。
为什么即使令牌在序列中被拒绝,推测采样也能取得进展?
单个目标前向传递在最后一个接受的令牌之后产生下一个令牌分布,因此至少有一个令牌总是前进。
哪一种是避免单独草案模型的“自我推测”方法?
Medusa 和 EAGLE 添加额外的头或使用提前退出,因此相同的模型提出未来的代币,从而消除了对不同草稿模型的需要。