跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
← 返回所有测验
引导式测验 • 中等 等级 • 6 问题
迭代 DPO 和在线偏好调整测验
检查您对迭代和在线偏好优化如何改进语言模型的掌握。
相关引导路径
迭代 DPO 和在线偏好调整
问题 1 的 6
DPO 避免了传统 RLHF (PPO) 要求的哪些内容?
需要提示吗?
A
任何训练数据
B
训练单独的显式奖励模型
C
使用神经网络
D
完全是人类的喜好