跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
首頁
/
詞彙表
/
培訓後
人工智慧術語
什麼是
培訓後
?
定義
預訓練後應用的訓練步驟,例如指令調整、偏好最佳化和安全調整。
相關術語
DPO(直接偏好優化)
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
訓練中期
預訓練和訓練後之間的中間訓練階段,通常用於能力或領域調整。
參數高效率微調 (PEFT)
透過訓練一小部分添加參數來調整模型的方法。
預訓練
在下游適應之前對廣泛資料進行初步大規模模型訓練。
評估集
用於測量訓練後模型品質的保留資料集。
微調
對特定領域的資料進行持續訓練,以使預先訓練的模型適應特定任務。
在我們的免費指南中了解更多信息
AI Training
Pseudo-Labeling and Self-Training
ELECTRA Pretraining
RoBERTa Training Recipe
參見
Self-Play
Watermarking
RAG-Fusion
Citations
Multi-Query Retrieval
Factuality
Parent-Document Retrieval
GSM8K
Previous
Mid-training
Next
Self-Play
瀏覽完整的人工智慧術語表
探索所有免費的人工智慧指南