跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
← 回傳所有測驗
引導式測驗 • 硬 等級 • 6 問題
RLHF 測驗中的分組獎勵標準化
測試您對分組獎勵標準化和 GRPO 演算法的理解。
相關引導路徑
Rlhf 中的分組獎勵標準化
問題 1 的 6
在分組獎勵標準化中,每個回應的獎勵與什麼進行比較?
需要提示嗎?
A
固定的全域常數
B
其自身提示組的平均值和標準差
C
上一個紀元的獎勵
D
模型參數個數