基礎知識指南

RLHF 中的分組獎勵標準化

分組獎勵標準化標準化了模型在對同一提示的一批響應中的獎勵,將噪音分數轉換為穩定的訓練訊號。

閱讀時間約2分鐘最後更新

概述

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

深入探討

在基於人類回饋的強化學習 (RLHF) 中,模型會產生反應,獎勵模型會對它們進行評分,但原始獎勵是嘈雜的,並且在不同提示之間差異很大。分組獎勵標準化透過對相同提示的多個回應進行取樣來解決此問題,然後透過減去組平均值並除以組的標準差來標準化每個獎勵。這個 z 分數成為優勢。該方法是 DeepSeek 推出的組相對策略優化 (GRPO) 的核心,該優化為 DeepSeek-R1 的推理提供了強大的支援。至關重要的是,GRPO 消除了 PPO 使用的單獨價值網絡(批評者),因為群體平均值充當基線。這使得訓練更簡單、更便宜、更節省內存,同時保持梯度訊號的良好縮放。

技術洞察

對於一組具有獎勵 r_1...r_G 的輸出,優勢為 A_i = (r_i −mean(r)) / std(r)。比小組平均更好的反應會獲得積極的優勢並且得到強化;低於平均水平的則被推低。因為比較在提示內是相對的,所以絕對獎勵規模和每個提示的難度相互抵消,從而減少了變異數。 GRPO 將 PPO 的修剪目標和 KL 懲罰保留在參考策略上,以防止模型偏離太遠。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

RLHF 分組獎勵標準化的未來

分組標準化正在推動推理模型的繁榮,其中模型可以從可驗證的獎勵(例如正確的數學答案)中學習,而無需博學的批評者。研究正在完善它:關於是否除以標準差、處理產生零優勢的全正確或全錯誤組以及縮放組大小的爭論。預計分組的、無批評的方法將擴展到代理工具使用和代碼生成,其中自動驗證器提供廉價、豐富的獎勵訊號。

現實世界的實施

透過對每個問題的 16 個解決方案進行抽樣來訓練數學推理模型,並對高於小組平均正確率的解決方案進行獎勵。

透過標準化每個用戶提示的多個候選回應的獎勵模型分數來微調聊天機器人的幫助性。

改進編碼助手,根據每個採樣解決方案是否透過單元測試對其進行評分,然後在組內進行標準化。

透過刪除 PPO 批評者網路並使用群組平均值作為基線來減少 RLHF 管道中的 GPU 記憶體。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄 RLHF 中的分組獎勵標準化在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

偏好優化中的長度標準化

常見問題

What is Grouped Reward Normalization in RLHF?

分組獎勵標準化標準化了模型在對同一提示的一批響應中的獎勵,將噪音分數轉換為穩定的訓練訊號。這是 GRPO 背後的核心技巧,GRPO 是為許多現代推理模型提供支援的演算法。

在分組獎勵標準化中,每個回應的獎勵與什麼進行比較?

每個獎勵都會使用相同提示的反應組的平均值和標準差轉換為 z 分數。

哪種演算法與分組獎勵標準化最相關?

GRPO 由 DeepSeek 引入並在 DeepSeek-R1 中使用,它是圍繞標準化群體內的獎勵而構建的。

GRPO 特別消除了標準 PPO 的哪些組成部分?

透過使用群組平均值作為基線,GRPO 丟棄了學習批評家,從而節省了記憶體和計算量。

如果回應的獎勵低於其組別的平均值,會發生什麼情況?

減去群體平均值會使低於平均的反應具有負面優勢,從而使政策遠離他們。

為什麼組內標準化可以減少訓練變異數?

由於每個提示中的比較都是相對的,因此絕對規模和提示難度上的差異會被消除。