N 次最佳采样和重新排序
Best-of-N 采样从模型中生成多个候选答案,然后使用单独的评分步骤选择最佳答案。
概述
It is one of the simplest, most reliable ways to trade extra compute at inference time for higher answer quality.
深入探讨
每次运行时,带有采样的语言模型都会产生不同的输出。 Best-of-N 利用了这一点:您绘制 N 个候选响应,然后对它们重新排序并返回顶部的响应。重新排名器可以是学习奖励模型(常见于根据人类反馈进行强化学习)、检查正确性的验证器或简单的启发式方法,例如通过多数投票达成答案协议。由于模型只需要多次尝试中的一次,因此质量通常会随着 N 的增长而急剧上升,特别是在存在正确路径但并不总是第一个样本的推理和代码任务上。成本与 N 成线性关系,如果评分者不完美,收益最终会趋于稳定甚至逆转,这种失败模式称为奖励黑客或奖励过度优化。
技术洞察
N 局最佳的质量完全取决于得分手。有了完美的验证器,准确率就接近 N 个样本中至少有一个是正确的,并且随着 N 的增加而迅速上升。使用嘈杂的奖励模型,选择可能会被愚弄:将 N 推得很高会放大得分高但实际上是错误的输出,因为你正在针对评分者的盲点进行优化。这就是为什么经过校准、稳健的奖励模型对于保持回报的技术至关重要。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
Best-of-N 采样和重新排序的未来
Best-of-N 正在成为推理时间扩展的核心构建块,与思维链和树搜索并列。期待更智能的变体:加权多数投票、对每个推理步骤进行评分的过程奖励模型,以及一旦置信度较高就停止采样的自适应 N。随着验证者的改进,特别是对于可检查正确性的代码和数学,对许多样本进行重新排序将成为将备用计算转换为可靠性而无需重新训练基本模型的标准方法。
现实世界的实施
对数学问题的 64 个解决方案进行抽样,并选择大多数样本都同意的答案(自我一致性/多数投票)。
生成多个代码完成并保留通过最多单元测试的代码作为自动验证器。
在 RLHF 管道中绘制多个响应,并选择奖励模型得分最高的响应来为用户提供服务。
生成几份摘要草稿,并使用质量模型对它们进行重新排序,以返回最忠实、简洁的摘要。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Best-of-N Sampling and Reranking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Best-of-N Sampling and Reranking?
Best-of-N 采样从模型中生成多个候选答案,然后使用单独的评分步骤选择最佳答案。这是在推理时用额外计算换取更高答案质量的最简单、最可靠的方法之一。
best-of-N采样的核心思想是什么?
Best-of-N 抽取多个候选响应,然后对它们重新排名,返回得分最高的响应。
best-of-N 对哪些类型的任务最有帮助?
当模型有时只能找到可验证的正确答案时,对更多候选者进行抽样会增加正确答案的机会。
是什么在很大程度上决定了“N 中最佳”是否能够真正改善结果?
选择的好坏取决于重新排序的好坏;弱者或有偏见的评分者可能会选择错误的答案。
当 N 在不完美的奖励模型下被推得很高时,会出现什么失败模式?
针对有缺陷的记分员进行大力优化会放大利用其盲点的输出,因此准确性可能会趋于稳定或下降。
哪种简单的重新排名策略也称为自我一致性?
自洽性对许多推理链进行采样,并选择大多数推理链都同意的最终答案。