跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
← 返回所有测验
引导式测验 • 中等 等级 • 6 问题
直接偏好优化测验
测试您对直接偏好优化如何工作以及它为何简化对齐的理解。
相关引导路径
直接偏好优化
问题 1 的 6
与传统的 RLHF 相比,DPO 消除了什么?
需要提示吗?
A
需要任何人类偏好数据
B
单独的奖励模型和强化学习循环
C
基础预训练语言模型
D
对数概率的使用