集團相關政策優化
群體相對策略最佳化 (GRPO) 是一種用於微調語言模型的強化學習方法,該方法根據同一提示的一組兄弟答案來判斷每個答案,從而消除了 PPO 使用的單獨價值網絡。
概述
It became famous as the core training trick behind DeepSeek's reasoning models.
深入探討
GRPO 是策略梯度強化學習的變體,旨在使大型語言模型的 RL 微調更便宜、更穩定。標準 PPO 需要一個有學識的「批評者」(價值模型),其大小大致與政策本身一樣大,以估計每個代幣的好壞。 GRPO 完全消除了這個批評。對於每個提示,它都會對一組完成進行採樣(例如 8-64),用獎勵信號對它們進行評分,然後通過根據組的平均值和標準差標準化其獎勵來計算每個完成的優勢。高於平均的答案會被強化,低於平均的答案會被抑制。 KL 散度項使模型接近參考策略。它由 DeepSeek 推出,為 DeepSeekMath 和 DeepSeek-R1 推理模型提供支援。
技術洞察
關鍵思想是用蒙特卡羅組基線取代 PPO 的學習值基線。對於一組具有獎勵 r_i 的輸出,每個優勢為 A_i = (r_i -mean(r)) / std(r)。歸一化分數乘以截斷機率比,與 PPO 完全相同,並且針對凍結參考模型的 KL 懲罰可以抑制漂移。因為沒有接受過訓練的批評家,所以內存和計算量大約減半,並且按提示標準化提供了自然縮放的低方差優勢。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
集團相關政策優化的未來
GRPO 已迅速成為訓練開放推理模型的預設方法,實驗室正在迭代其弱點。研究人員正在探索修復長度和難度偏差(例如 GRPO 博士)、令牌級別而非序列級別標準化,以及刪除或重塑 KL 術語。期望與可驗證的獎勵(數學、代碼、工具使用)更緊密地集成,更好地處理稀疏信號,以及將群體基線與輕量級批評家相結合的混合體,以實現代理、多步驟任務。
現實世界的實施
訓練 DeepSeek-R1 和 DeepSeekMath 使用基於規則的正確性獎勵對數學問題進行長鏈思維推理
微調代碼生成模型,其中每個採樣解決方案根據是否通過單元測試進行評分,並且該組被標準化以挑選獲勝者
開源 RLHF 管道(例如,在 TRL 和 verl 庫中)使用 GRPO 來調整聊天模型,而無需支付單獨的價值網絡費用
透過對每個提示的多個回應進行取樣並獎勵相對於同儕而言獎勵模型評分最高的回應,改善指令遵循或安全行為
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Group Relative Policy Optimization?
群體相對策略最佳化 (GRPO) 是一種用於微調語言模型的強化學習方法,該方法根據同一提示的一組兄弟答案來判斷每個答案,從而消除了 PPO 使用的單獨價值網絡。它以 DeepSeek 推理模型背後的核心訓練技巧而聞名。
GRPO 消除了 PPO 的哪些主要成分?
GRPO 的簽章變更正在放棄 PPO 的學習值/批評模型,該模型通常與策略大小相同,從而節省大量記憶體和計算。
GRPO 如何計算給定完成的優勢?
每次完成的優勢是(獎勵 - 組平均值)/組標準差,因此同一提示的答案組作為基線。
哪些車款讓 GRPO 廣為人知?
GRPO 由 DeepSeek 引入並普及,特別是在 DeepSeekMath 中以及作為 DeepSeek-R1 推理模型背後的 RL 引擎。
KL 散度項在 GRPO 中扮演什麼角色?
針對參考(通常是強化學習前)模型的 KL 懲罰可以規範訓練,使策略得到改進,而不會崩潰或陷入退化輸出。
為什麼 GRPO 對於訓練數學或程式碼推理模型特別有吸引力?
對許多解決方案進行採樣並透過自動正確性檢查對其進行評分,與 GRPO 的群體歸一化優勢完美結合,無需批評家。