测试时计算扩展
测试时计算扩展意味着在模型回答问题时给予模型更多的思考时间和计算,而不是仅仅在训练期间使其更大。
概述
It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.
深入探讨
多年来,人工智能的进步意味着扩展训练:更多数据、更多参数、更多预训练计算。测试时计算缩放添加了第二个轴,在推理上花费更多计算。推理模型不是立即给出答案,而是生成一个很长的内部思维链,探索步骤、检查工作和回溯。技术包括扩展思想链、对许多候选解决方案进行采样并选择最佳解决方案(自洽或 N 中最佳),以及由验证者或奖励模型引导的树式搜索。 OpenAI 的 o1 和 o3、DeepSeek-R1 和 Claude 的扩展思维普及了这一点:当你让模型“思考得更久”时,竞赛数学和编程的准确性会急剧上升,在快速回答失败的情况下,用延迟和成本来换取问题的正确性。
技术洞察
该模型通过强化学习进行训练,以产生有用的推理标记,然后在推理时分配“思维预算”。更多的代币可以让它分解问题、捕获自己的错误并进行自我验证。 Best-of-N 采样和验证者引导的搜索添加了并行计算:生成多次尝试,对它们进行评分,保留获胜者。至关重要的是,具有大量测试时间计算能力的较小模型可以与立即给出答案的较大模型相匹配,从而重塑成本曲线。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
测试时计算扩展的未来
测试时计算现在是与训练一起的主要扩展杠杆。预计模型会根据难度来决定思考的难度,通过将长链提炼为较短的链来进行更便宜的推理,以及将思维与工具调用和网络搜索交织在一起的“代理”循环。随着推理硬件的改进,深思熟虑的推理将成为科学研究、软件工程和复杂规划等高风险任务的默认方式,而快速查找将保持快速且廉价。
现实世界的实施
OpenAI 的 o1 和 o3 模型逐步思考奥林匹克级别的数学问题,在 AIME 和竞赛基准上显着超越即时答案模型。
DeepSeek-R1 使用强化学习来教授长链思维推理,公开展示了额外推理计算带来的巨大准确性提升。
Claude 的扩展思维模式允许开发人员设置令牌预算,以便模型在回复之前对复杂的编码或分析任务进行更长时间的推理。
AlphaCode 和类似的系统在测试时对数千个候选程序进行采样,然后对它们进行过滤和排名以解决竞争性编程挑战。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Test-Time Compute Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Test-Time Compute Scaling?
测试时计算扩展意味着在模型回答问题时给予模型更多的思考时间和计算,而不是仅仅在训练期间使其更大。这是“推理模型”背后的突破,可以通过在响应之前深思熟虑来解决困难的数学和编码问题。
“测试时计算”指的是什么?
测试时(推理时)计算是生成答案时完成的工作,与预训练期间使用的计算不同。
像 o1 这样的推理模型如何使用额外的测试时计算?
他们会进行扩展的逐步推理、探索和检查解决方案,然后做出最终答复。
测试时计算扩展的核心权衡是什么?
让模型思考更长时间可以提高解决难题的正确性,但会增加响应时间和计算成本。
什么是“N 次最佳”采样?
Best-of-N 并行生成多个解决方案尝试,并使用评分器或验证器来保留最强的一个,这是测试时间缩放的一种形式。
为什么测试时计算被视为新的“缩放轴”?
多年来,规模化意味着更大规模的训练;测试时计算增加了第二种提高能力的方法,即在推理时进行更多计算。