近端策略優化
近端策略最佳化 (PPO) 是與根據人類回饋微調語言模型最相關的強化學習演算法。
概述
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
深入探討
PPO 由 OpenAI 於 2017 年推出,並成為 InstructGPT 和 ChatGPT 等系統的 RLHF 背後的主力。策略梯度強化學習的核心挑戰是單一過大的更新可能會導致表現崩潰。 PPO 透過「修剪替代目標」來解決這個問題:它衡量與舊政策相比,某項行動的可能性增加(或減少)了多少,將該比率乘以優勢(該行動比預期好多少),並將該比率限制在一個較小的範圍內,例如 0.8 到 1.2。這限制了策略每次更新可以移動的距離,並保持學習穩定,同時仍允許穩步改進。在語言模型 RLHF 中,「動作」是產生令牌或回應,獎勵來自獎勵模型,KL 散度懲罰可以防止模型偏離其原始行為太遠。
技術洞察
PPO 最大化剪輯目標:min(ratio * Advantage, Clip(ratio, 1-eps, 1+eps) * Advantage),其中ratio 是新舊動作機率。通常使用廣義優勢估計和學習值(批評)網路來估計優勢。在 RLHF 中,總獎勵將獎勵模型分數與每個針對參考策略的代幣 KL 懲罰相結合,平衡獎勵增益與保持接近原始模型。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
近端策略優化的未來
PPO 仍然很強大,但出了名的複雜:它需要一個單獨的價值網絡、仔細的超參數調整和大量的計算。更簡單的替代方案正在普及,包括 DPO(根本沒有 RL)和 GRPO,它通過估計採樣響應組的優勢來降低價值網絡,並為最近的推理模型提供了動力。 PPO 將在政策探索真正有幫助的地方繼續存在,但該領域正在積極地將其一些複雜性換成更便宜的方法。
現實世界的實施
透過 RLHF 微調 InstructGPT 和 ChatGPT 以遵循指令和人類偏好
訓練遊戲和機器人控制代理,PPO 在語言模型之前的原始領域
透過在 KL 約束下最大化獎勵模型分數來減少毒性或提高幫助性
優化工具使用或多步驟代理行為,其中模型因正確完成任務而獲得獎勵
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Proximal Policy Optimization?
近端策略最佳化 (PPO) 是與根據人類回饋微調語言模型最相關的強化學習演算法。它以謹慎的小步驟改進政策,以避免困擾幼稚政策梯度方法的不穩定性。
PPO 的「裁切」主要解決什麼問題?
修剪機率比可以防止任何單一更新使策略移動得太遠,這是策略梯度方法不穩定的主要來源。
在具有 PPO 的語言模型 RLHF 中,獎勵訊號通常來自哪裡?
獎勵模型為產生的反應提供標量獎勵,因為讓人類在強化學習期間對每個輸出進行評分是不可行的。
KL 散度懲罰在基於 PPO 的 RLHF 中起什麼作用?
針對原始(參考)策略的每個代幣 KL 懲罰會阻止模型在追逐獎勵時過於劇烈地改變其行為。
價值(批評)網絡在 PPO 中的作用是什麼?
PPO是一種演員批評家方法;價值網絡估計預期獎勵,從而實現優勢估計(通常透過 GAE),從而減少變異數。
PPO 的「優勢」代表什麼?
優勢衡量所選行動相對於價值估計的良好(或較差)程度,告訴政策要加強哪些行動。