语言人工智能指南

思维链推理

思维链推理是指模型在给出最终答案之前以书面形式逐步解决问题。

阅读时间:2分钟最后更新

概述

这个简单的改变极大地提高了数学、逻辑和多步骤问题的准确性。

深入探讨

思维链 (CoT) 模型不会直接跳到答案,而是写出中间步骤,就像在数学课上展示你的作业一样。 Jason Wei 及其同事在 2022 年发表的一篇 Google 论文表明,通过逐步推理的有效示例来提示大型模型可以显着提高困难任务的性能。不久之后,小岛和同事发现,简单地添加“让我们一步一步思考”就会触发完全没有示例的推理——称为零样本 CoT。至关重要的是,这种好处是一种新兴能力:它主要出现在大型模型中,对小型模型几乎没有帮助。一种称为“自我一致性”的改进对多个推理路径进行采样并采用最常见的答案,从而进一步提高可靠性。

技术洞察

编写中间步骤为模型提供了更多的计算“空间”——每个生成的步骤都成为制约下一个步骤的输入的一部分,使其将难题分解为更简单的子步骤,而不是一次性猜测。 2025 年的推理模型浪潮,如 OpenAI 的 o 系列和 DeepSeek-R1 直接构建了这一点:它们不再依赖提示,而是通过强化学习进行训练,以产生长的内部思维链,在回答之前进行探索、检查和纠正。 R1 特别表明推理可以从纯强化学习中产生。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

思维链推理的未来

思维链已经从一种提示技巧演变成一种训练范式。预计会有更多的“推理模型”在推理上花费额外的计算——所谓的测试时计算——以速度换取解决难题的准确性,并且工作量水平可调。悬而未决的问题包括书面的链条是否忠实地反映了模型的实际过程,如何防止长时间的推理发明错误,以及如何平衡成本。推理质量,而不仅仅是原始知识,正在成为顶级模型竞争的主轴。

现实世界的实施

通过将每个算术步骤放在最终数字之前来解决多步骤数学应用题。

通过推理每一行的作用以及逻辑中断的位置来调试代码。

回答需要同时跟踪多个约束的逻辑难题或规划任务。

使用自洽性对多个解决方案路径进行采样,并为棘手的问题选择最常见的答案。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chain-of-Thought Reasoning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

思维树推理

常见问题

什么是思维链推理?

思维链推理是指模型在给出最终答案之前以书面形式逐步解决问题。这个简单的改变极大地提高了数学、逻辑和多步骤问题的准确性。

链式推理是什么意思?

思想链促使模型逐步展示其工作原理,从而提高了多步骤问题的准确性。

哪个简单的短语可以在没有示例的情况下触发逐步推理(零样本 CoT)?

小岛等人。 (2022)发现,即使没有有效的例子,附加“让我们一步一步思考”也能促进推理。

自洽技术有什么作用?

自我一致性会产生多个独立的思想链,并对答案进行多数投票,从而提高可靠性。

2025 年时代的推理模型(例如 OpenAI 的 o 系列和 DeepSeek-R1)与普通 CoT 提示有何不同?

这些推理模型通过训练(特别是强化学习)将逐步思考融入到模型中,因此它们每次推理时都不需要特殊提示。

为什么编写中间步骤往往会改进模型的答案?

每个书面步骤都会成为下一个步骤的背景,为模型提供分解问题的空间,而不是一次性猜测——尽管它不能保证正确性。