跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
首页
/
词汇表
/
培训后
人工智能术语
什么是
培训后
?
定义
预训练后应用的训练步骤,例如指令调整、偏好优化和安全调整。
相关术语
DPO(直接偏好优化)
一种直接在偏好对上微调模型的训练方法,无需单独的奖励模型。
训练中期
预训练和训练后之间的中间训练阶段,通常用于能力或领域调整。
参数高效微调 (PEFT)
通过训练一小部分添加参数来调整模型的方法。
预训练
在下游适应之前对广泛数据进行初始大规模模型训练。
评估集
用于测量训练后模型质量的保留数据集。
微调
对特定领域的数据进行持续训练,以使预先训练的模型适应特定任务。
在我们的免费指南中了解更多信息
AI Training
Pseudo-Labeling and Self-Training
ELECTRA Pretraining
RoBERTa Training Recipe
参见
Self-Play
Watermarking
RAG-Fusion
Citations
Multi-Query Retrieval
Factuality
Parent-Document Retrieval
GSM8K
Previous
Mid-training
Next
Self-Play
浏览完整的人工智能术语表
探索所有免费的人工智能指南