技术指南

计划与解决提示

计划与解决 (PS) 提示告诉语言模型首先设计一个明确的计划,然后逐步执行它,修复简单的“让我们一步一步思考”提示留下的失败。

阅读时间:2分钟最后更新

概述

It is a simple prompt tweak that meaningfully boosts multi-step reasoning without any extra training.

深入探讨

Lei Wang 及其同事在 2023 年的 ACL 论文中介绍,计划与解决提示是针对零样本思维链中特定弱点的回应:模型经常跳过步骤、错误计算或误读问题。 PS 将单一指令“让我们一步一步思考”替换为由两部分组成的指令:“让我们首先了解问题并制定解决方案”。那么,我们就按照计划一步一步地解决问题吧。增强版 PS+ 添加了提取相关变量、计算中间结果和注意数字的提醒。在 GSM8K 和 SVAMP 等基准测试中,PS+ 通过少量的思考链缩小了大部分差距,同时不需要提示中的有效示例。

技术洞察

该机制纯粹是在提示中:通过在执行前询问计划,PS 会改变模型的自回归生成,因此它首先产生高级子目标,然后条件化随后的详细推理标记。这种分离减少了“遗漏步骤”和计算错误。 PS+ 通过明确命名变量和中间量来进一步引导注意力,充当自行生成的支架,而不是依赖于手写的示例。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

计划与解决提示的未来

计划和解决的思维现在已经融入到代理框架和“推理”模型中,这些模型本身就将计划与执行分开。预计规划提示将与工具使用、自我验证和树搜索方法合并,并成为训练有素模型中的内部默认行为,而不是手动提示。持久的教训是,在行动之前分解任务是一种廉价的、可广泛转移的可靠性增益。

现实世界的实施

解决多步骤小学数学应用题 (GSM8K),其中模型首先列出数量,然后按顺序计算它们。

在编写任何实现代码之前指导编码助理概述功能和边缘情况。

构建客户支持代理,首先确定用户的根本目标,然后按顺序解决解决步骤。

将复杂的数据分析请求分解为“规划查询”和“运行并组合结果”阶段。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Plan-and-Solve Prompting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

从最少到最多的提示

常见问题

What is Plan-and-Solve Prompting?

计划与解决 (PS) 提示告诉语言模型首先设计一个明确的计划,然后逐步执行它,修复简单的“让我们一步一步思考”提示留下的失败。这是一个简单的提示调整,无需任何额外的培训即可有意义地增强多步骤推理。

计划与解决提示对标准零样本思维链有何核心变化?

PS 提示将指令分解为制定计划,然后逐步执行,而不是单一的“让我们一步一步思考”。

计划与解决方案旨在解决简单思维链的哪些具体弱点?

作者针对零样本思维链经常产生的缺失步骤错误和算术/计算错误。

增强型 PS+ 变体在基本的“规划和求解”提示中添加了哪些内容?

PS+添加了详细的提醒,以提取相关变量、计算中间结果、关注数字,锐化自生成的脚手架。

“计划与解决”主要根据哪种类型的基准进行评估?

PS 和 PS+ 在 GSM8K 和 SVAMP 等数学推理基准以及其他推理数据集上进行了测试。

为什么在详细步骤之前生成计划往往有助于自回归模型?

由于生成是自回归的,因此高级计划标记成为指导后续逐步推理的上下文,从而减少跳过的步骤。