跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
首页
/
词汇表
/
根据人类反馈进行强化学习 (RLHF)
人工智能术语
什么是
根据人类反馈进行强化学习 (RLHF)
?
定义
一种使用人类偏好信号来塑造模型行为的训练方法。
相关术语
强化学习
通过奖励信号进行训练,代理学习能够最大化长期回报的行动。
奖励模式
一种根据偏好信号对输出进行评分的模型,通常用于 RLHF 管道。
DPO(直接偏好优化)
一种直接在偏好对上微调模型的训练方法,无需单独的奖励模型。
持续学习
让模型不断从新数据中学习而不忘记先验知识的训练方法。
少样本学习
仅从少量示例中学习或适应行为。
模型漂移
由于现实条件与训练假设存在差异,性能会随着时间的推移而下降。
在我们的免费指南中了解更多信息
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
参见
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
浏览完整的人工智能术语表
探索所有免费的人工智能指南