流程獎勵模型
過程獎勵模型(PRM)對人工智慧推理的每個步驟進行評分,而不僅僅是最終答案。
概述
This matters because it catches faulty logic mid-stream, making models more reliable at math, coding, and multi-step reasoning.
深入探討
大多數獎勵模型都是「結果」模型:它們查看完成的答案並判斷它是對還是錯。相反,過程獎勵模型對推理鏈中的每個步驟進行評分,為解決方案的每一行分配品質或正確性分數。著名的例子是 OpenAI 的 2023 年「讓我們逐步驗證」工作,其中在 PRM800K 資料集(數學解決方案上大約 800,000 個人類步驟級標籤)上訓練的 PRM 在 MATH 基準上的表現大大優於僅結果監督。這樣做的好處是,最終的答案可能是靠運氣而正確的,而推理卻被打破了;或者,儘管大部分步驟都是正確的,但最終的答案可能是錯誤的。透過獎勵正確的中間步驟,PRM 可以提供更密集、更有針對性的回饋,從而改善驗證(選擇許多樣本解決方案中最好的)和透過強化學習進行的訓練。
技術洞察
PRM 通常是一個轉換器,它在每個推理步驟之後輸出標量分數,通常在特殊的分隔符號標記處。要從許多採樣鏈中選擇最終答案,您通常會透過採用最小步驟機率(鏈的強度取決於其最弱的步驟)或乘積來匯總步驟分數。收集步驟標籤的成本很高,因此像 Math-Shepherd 之類的方法透過蒙特卡羅推出自動標記步驟,根據步驟產生正確答案的頻率來估計步驟的價值。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
過程獎勵模型的未來
PRM 是推理模型時代的核心。期望更多的自動步驟標記可以降低人工註釋成本,生成式 PRM 可以用自然語言批評步驟而不是給出簡單的分數,並且可以從數學擴展到程式碼、代理工具使用和科學推理。它們還自然地與樹搜尋和測試時計算配對,其中驗證器指導擴展哪些分支。一個關鍵的公開挑戰是獎勵駭客:模型學習產生對 PRM 來說看起來不錯的步驟,但實際上並不正確。
現實世界的實施
按步數對硬數學競爭問題的數十個採樣解決方案進行重新排序,然後返回得分最高的鏈。
在推理模型中引導樹搜索,僅擴展 PRM 評價較高的中間步驟的部分解決方案。
使用 Math-Shepherd 風格的 Monte Carlo 捲展自動標記訓練數據,以便無需詳盡的人工註釋即可訓練 PRM。
逐步驗證程式碼生成,標記函數邏輯偏離規範的特定行。
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Process Reward Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Process Reward Models?
過程獎勵模型(PRM)對人工智慧推理的每個步驟進行評分,而不僅僅是最終答案。這很重要,因為它可以在中途捕捉錯誤的邏輯,使模型在數學、編碼和多步驟推理方面更加可靠。
過程獎勵模型與結果獎勵模型的主要差異是什麼?
PRM 為推理鏈中的每一步打分,而結果模型只判斷最終結果。
哪個著名的人類步驟層級數學標籤資料集與 PRM 研究相關?
PRM800K 與 OpenAI 的「讓我們逐步驗證」一起發布,包含約 800,000 個數學解決方案的步驟級標籤。
為什麼只注重結果的獎勵訊號會產生誤導?
結果評分會漏掉一些情況,即儘管中間工作做得很好,但答案是靠運氣正確或錯誤的,而步驟級評分會捕捉到這一點。
Math-Shepherd 方法使用什麼來自動標記步驟?
Math-Shepherd 透過從該點取樣許多完成情況並測量它們達到正確答案的頻率來估計步驟的值。
針對 PRM 訓練模式時,哪些風險特別相關?
模型可以學習與驗證者博弈,產生看似合理的步驟,得分很高,但實際上並不是合理的推理。