語言人工智慧指南

数学推理过程监督

過程監督會獎勵推理鏈中每一個正確步驟的模型,而不僅僅是最終答案。

閱讀時間約2分鐘最後更新

概述

For math, where one wrong move ruins everything, grading the work itself produces far more reliable solvers.

深入探討

大多數獎勵模型僅對最終答案(結果監督)進行評分。這讓模型「很幸運」——透過有缺陷的步驟達到正確的數字,但這些步驟會相互抵消。相反,流程監督在人類或人工智慧標籤上訓練流程獎勵模型(PRM),將每個中間步驟標記為正確、不正確或中性。 OpenAI 的 2023 年「讓我們逐步驗證」論文發布了 PRM800K,即數學問題的大約 800,000 個步驟級標籤,並顯示過程監督驗證器解決了測試子集的 78%,而較弱的僅結果基線。 PRM 用於推理對許多取樣解決方案進行排序,選擇具有最高最小步驟分數的鏈。它還提供可解釋的回饋:您可以準確地看到推理的錯誤之處。

技術洞察

在測試時,模型會採樣許多候選解決方案; PRM 對每個步驟進行評分,解決方案的總體分數通常是每個步驟正確性機率的乘積(或最小值)。然後“Nest-of-N”選擇得分最高的鏈條。由於信用是在本地分配的,因此訓練訊號比單一序列結束獎勵更密集且噪音更小,這減少了錯誤步驟同時產生正確答案的獎勵駭客行為。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

數學推理過程監督的未來

手動步驟標記成本高昂,因此研究正在轉向自動化過程監督——使用蒙特卡羅推出(Math-Shepherd)來估計每個步驟的值,而無需人工標記,或讓更強的模型判斷較弱的步驟。期望 PRM 能夠推動強化學習微調,而不僅僅是重新排名,並從數學擴展到程式碼、科學證明和代理多步驟規劃,其中步驟層級的正確性很重要。

現實世界的實施

OpenAI 的 PRM800K 資料集:800K 人類步驟層級標籤,用於在 MATH 基準上訓練驗證者

Math-Shepherd:透過蒙特卡羅推出自動標記步驟正確性,以避免昂貴的人工註釋

Best-of-N 重新排名:產生 256 個解決方案並選擇每一步 PRM 得分最高的一個

輔導工具可以標記學生解決方案中首次出現錯誤的確切行

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Process Supervision for Math Reasoning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

思考鏈推理

常見問題

What is Process Supervision for Math Reasoning?

過程監督會獎勵推理鏈中每一個正確步驟的模型,而不僅僅是最終答案。對數學來說,一個錯誤的舉動就會毀掉一切,而對工作本身進行評分會產生更可靠的解算器。

過程監督和結果監督之間的主要區別是什麼?

過程監督在每個推理步驟提供獎勵訊號,而結果監督僅檢查最終答案。

為什麼只注重結果的監督會對數學問題產生誤導?

僅獎勵最終答案會歸功於「幸運」的解決方案,其中不正確的中間步驟恰好產生了正確的結果。

OpenAI 與「讓我們逐步驗證」一起發布了什麼?

PRM800K 包含約 800,000 個人工註釋,將各個推理步驟標記為正確或錯誤。

在推理時通常如何使用過程獎勵模型?

PRM 對許多候選解決方案的每一步進行評分,從而能夠選擇得分最高的推理鏈。

什麼方法可以減少對昂貴的人工步驟標籤的需求?

Math-Shepherd 透過推出完成結果並測量正確答案的頻率來估計步驟的正確性,從而避免手動標記。