語言人工智慧指南

思考鏈推理

思維鏈推理是指模型在給出最終答案之前以書面形式逐步解決問題。

閱讀時間約2分鐘最後更新

概述

This simple change dramatically improves accuracy on math, logic, and multi-step questions.

深入探討

思考鏈 (CoT) 模型不會直接跳到答案,而是寫出中間步驟,就像在數學課上展示你的作業一樣。 Jason Wei 及其同事在 2022 年發表的一篇 Google 論文表明,透過逐步推理的有效範例來提示大型模型可以顯著提高困難任務的表現。不久之後,小島和同事發現,簡單地添加「讓我們一步一步思考」就會觸發完全沒有範例的推理——稱為零樣本 CoT。至關重要的是,這種好處是一種新興能力:它主要出現在大型模型中,對小型模型幾乎沒有幫助。一種稱為「自我一致性」的改進對多個推理路徑進行採樣並採用最常見的答案,從而進一步提高可靠性。

技術洞察

編寫中間步驟為模型提供了更多的計算「空間」——每個生成的步驟都成為限制下一個步驟的輸入的一部分,使其將難題分解為更簡單的子步驟,而不是一次性猜測。 2025 年的推理模型浪潮,如 OpenAI 的 o 系列和 DeepSeek-R1 直接構建了這一點:它們不再依賴提示,而是透過強化學習進行訓練,以產生長的內部思維鏈,在回答之前進行探索、檢查和糾正。 R1 特別表明推理可以從純強化學習中產生。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

思考鏈推理的未來

思維鏈已經從一種提示技巧演變成一種訓練範式。預計會有更多的「推理模型」在推理上花費額外的計算——所謂的測試時計算——以速度換取解決難題的準確性,並且工作量水平可調。懸而未決的問題包括書面的鏈條是否忠實地反映了模型的實際過程,如何防止長時間的推理發明錯誤,以及如何平衡成本。推理質量,而不僅僅是原始知識,正在成為頂級模型競爭的主軸。

現實世界的實施

透過將每個算術步驟放在最終數字之前來解決多步驟數學應用題。

透過推理每一行的作用以及邏輯中斷的位置來調試程式碼。

回答需要同時追蹤多個約束的邏輯難題或規劃任務。

使用自洽性對多個解決方案路徑進行採樣,並為棘手的問題選擇最常見的答案。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chain-of-Thought Reasoning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

思考樹推理

常見問題

What is Chain-of-Thought Reasoning?

思維鏈推理是指模型在給出最終答案之前以書面形式逐步解決問題。這個簡單的改變大大提高了數學、邏輯和多步驟問題的準確性。

鍊式推理是什麼意思?

思想鏈促使模型逐步展示其工作原理,從而提高了多步驟問題的準確性。

哪個簡單的短語可以在沒有範例的情況下觸發逐步推理(零樣本 CoT)?

小島等人。 (2022)發現,即使沒有有效的例子,附加「讓我們一步一步思考」也能促進推理。

自洽技術有什麼作用?

自我一致性會產生多個獨立的思想鏈,並對答案進行多數投票,從而提高可靠性。

2025 年時代的推理模型(例如 OpenAI 的 o 系列和 DeepSeek-R1)與普通 CoT 提示有何不同?

這些推理模型透過訓練(特別是強化學習)將逐步思考融入模型中,因此它們每次推理時都不需要特殊提示。

為什麼寫中間步驟往往會改進模型的答案?

每個書面步驟都會成為下一個步驟的背景,為模型提供分解問題的空間,而不是一次性猜測——儘管它不能保證正確性。