跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
← 返回所有测验
引导式测验 • 硬 等级 • 6 问题
根据人类反馈进行强化学习测验
测试您对 RLHF 背后的阶段和机制的理解。
相关引导路径
从人类反馈中强化学习
问题 1 的 6
RLHF 对于语言模型的主要目的是什么?
需要提示吗?
A
增加模型的参数数量
B
使其输出符合人类偏好,以提供帮助和安全
C
压缩模型以加快推理速度
D
将模型翻译成其他语言