自一致性解码
自洽是一种解码策略,它从语言模型中采样许多不同的推理路径,然后选择大多数人都同意的答案。
概述
It matters because a single greedy answer can be wrong, while the consensus across diverse attempts is far more often correct.
深入探讨
由 Google 研究人员于 2022 年引入,自一致性取代了通常的“贪婪”解码,即模型通过采样和投票方法在每一步承诺单个最有可能的下一个标记。这一想法建立在思维链提示的基础上:模型被要求逐步推理,但它不是生成一条链,而是使用非零温度对许多不同的链进行采样。每条链可能采取不同的路线,但正确的推理往往会收敛于相同的最终答案,而错误则分散在不同的方向。然后系统对最终答案进行多数投票。这个简单的改变在算术和常识推理基准(例如 GSM8K)上产生了巨大的进步,通常无需任何重新训练即可实现两位数的精度提升。
技术洞察
该方法利用了这样的直觉:有许多有效的方法可以得出正确的答案,但有无数的方法会导致错误。通过对 40 个温度高于零的链进行采样,该模型会产生不同的推理。只有最终答案是通过边缘化式的多数投票来汇总的;推理文本被丢弃。准确性通常会随着样本的增加而提高,但回报会递减,用额外的推理计算来换取可靠性。它不需要标记数据或微调。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
自一致性解码的未来
自一致性是推理时间扩展的一个基本示例,它的后代现在为推理模型提供动力,这些模型花费额外的计算来更深入地思考。未来的方向包括通过学习验证者或置信度分数对投票进行加权,而不是平均计数,根据问题难度自适应地选择要抽取的样本数量,以及将投票与思想树等搜索框架相结合。当正确性比延迟更重要时,期望它仍然是一个廉价的、免培训的基线,任何系统都可以分层。
现实世界的实施
通过对许多解决方案路径进行采样并对最终数字进行投票,提高小学数学应用题 (GSM8K) 的准确性。
提高多步骤常识性问题回答的可靠性,其中单个链可能会因一个推论而出错。
通过检查样本中哪个输出最一致,提高对代码生成答案的信心。
加强符号或逻辑推理任务,其中不同的推导应汇聚成一个正确的结论。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Consistency Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Self-Consistency Decoding?
自洽是一种解码策略,它从语言模型中采样许多不同的推理路径,然后选择大多数人都同意的答案。这很重要,因为单一的贪婪答案可能是错误的,而不同尝试的共识往往是正确的。
自一致性解码背后的核心思想是什么?
自我一致性对多个不同的推理链进行采样,并选择大多数推理链都同意的最终答案。
为什么采样不同的推理路径有助于准确性?
获得正确答案的有效途径有很多,但犯错的方式也有无数种,因此正确答案会聚集在一起,而错误会分散,从而使大多数答案更加可靠。
自一致性取代了什么解码方法?
与其贪婪地致力于一条最有可能的路径,不如在多条路径上进行自我一致性采样和聚合。
每个采样链的哪一部分实际用于最终投票?
中间推理被丢弃;仅通过多数票汇总最终答案。
使用自洽的主要成本是什么?
生成几十条推理链,推理成本成倍增加;随着样本数量的增加,准确性会提高,但收益会递减。