跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
← 返回所有测验
引导式测验 • 硬 等级 • 6 问题
RLHF 测验中的分组奖励标准化
测试您对分组奖励标准化和 GRPO 算法的理解。
相关引导路径
Rlhf 中的分组奖励标准化
问题 1 的 6
在分组奖励标准化中,每个响应的奖励与什么进行比较?
需要提示吗?
A
固定的全局常数
B
其自身提示组的平均值和标准差
C
上一个纪元的奖励
D
模型参数个数