跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
首页
/
词汇表
/
DPO(直接偏好优化)
人工智能术语
什么是
DPO(直接偏好优化)
?
定义
一种直接在偏好对上微调模型的训练方法,无需单独的奖励模型。
相关术语
根据人类反馈进行强化学习 (RLHF)
一种使用人类偏好信号来塑造模型行为的训练方法。
培训后
预训练后应用的训练步骤,例如指令调整、偏好优化和安全调整。
持续学习
让模型不断从新数据中学习而不忘记先验知识的训练方法。
微调
对特定领域的数据进行持续训练,以使预先训练的模型适应特定任务。
梯度下降
一种向减少误差的方向更新参数的优化方法。
指令调优
微调指令-响应对的模型以改善任务跟踪。
在我们的免费指南中了解更多信息
AI Inference Optimization
Bidirectional Recurrent Networks
Second-Order Optimization and Newton Methods
Odds Ratio Preference Optimization
参见
Tree of Thoughts
QLoRA
ReAct
Flash Attention
Agentic Loop
Multi-Head Attention
MCP (Model Context Protocol)
Positional Encoding
Previous
Tree of Thoughts
Next
QLoRA
浏览完整的人工智能术语表
探索所有免费的人工智能指南