技術指南

計劃與解決提示

計劃與解決 (PS) 提示告訴語言模型首先設計一個明確的計劃,然後逐步執行它,修復簡單的「讓我們一步一步思考」提示留下的失敗。

閱讀時間約2分鐘最後更新

概述

這是一個簡單的提示調整,無需任何額外的培訓即可有意義地增強多步驟推理。

深入探討

Lei Wang 及其同事在 2023 年的 ACL 論文中介紹,計劃與解決提示是針對零樣本思維鏈中特定弱點的回應:模型經常跳過步驟、錯誤計算或誤讀問題。 PS 將單一指令「讓我們一步一步思考」替換為由兩部分組成的指令:「讓我們先了解問題並製定解決方案」。那麼,我們就按照計畫一步一步解決問題吧。增強版 PS+ 增加了提取相關變數、計算中間結果和注意力數字的提醒。在 GSM8K 和 SVAMP 等基準測試中,PS+ 透過少量的思考鏈縮小了大部分差距,同時不需要提示中的有效範例。

技術洞察

該機制純粹是在提示中:透過在執行前詢問計劃,PS 會改變模型的自回歸生成,因此它首先產生高級子目標,然後條件化隨後的詳細推理標記。這種分離減少了「遺漏步驟」和計算錯誤。 PS+ 透過明確命名變數和中間量來進一步引導注意力,充當自行生成的支架,而不是依賴手寫的範例。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

計劃與解決提示的未來

計劃和解決的思維現在已經融入到代理框架和「推理」模型中,這些模型本身就將計劃與執行分開。預計規劃提示將與工具使用、自我驗證和樹搜尋方法合併,並成為訓練有素模型中的內部預設行為,而不是手動提示。持久的教訓是,在行動之前分解任務是一種廉價的、可廣泛轉移的可靠性增益。

現實世界的實施

解決多步驟小學數學應用題 (GSM8K),其中模型首先列出數量,然後按順序計算它們。

在編寫任何實現程式碼之前指導編碼助理概述功能和邊緣情況。

建立客戶支援代理,先確定使用者的根本目標,然後依序解決解決步驟。

將複雜的資料分析請求分解為「規劃查詢」和「運行並組合結果」階段。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Plan-and-Solve Prompting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

從最少到最多的提示

常見問題

什麼是計劃與解決提示?

計劃與解決 (PS) 提示告訴語言模型首先設計一個明確的計劃,然後逐步執行它,修復簡單的「讓我們一步一步思考」提示留下的失敗。這是一個簡單的提示調整,無需任何額外的培訓即可有意義地增強多步驟推理。

計畫與解決提示對標準零樣本思維鏈有何核心變化?

PS 提示將指令分解為製定計劃,然後逐步執行,而不是單一的「讓我們一步一步思考」。

計劃與解決方案旨在解決簡單思維鏈的哪些具體弱點?

作者針對零樣本思考鏈經常產生的缺失步驟錯誤和算術/計算錯誤。

增強型 PS+ 變體在基本的「規劃和求解」提示中添加了哪些內容?

PS+添加了詳細的提醒,以提取相關變數、計算中間結果、關注數字,銳化自生成的鷹架。

「計劃與解決」主要根據哪種類型的基準進行評估?

PS 和 PS+ 在 GSM8K 和 SVAMP 等數學推理基準以及其他推理資料集上進行了測試。

為什麼在詳細步驟之前產生計劃往往有助於自回歸模型?

由於生成是自回歸的,因此高級計劃標記成為指導後續逐步推理的上下文,從而減少跳過的步驟。