跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
首頁
/
詞彙表
/
DPO(直接偏好優化)
人工智慧術語
什麼是
DPO(直接偏好優化)
?
定義
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
相關術語
根據人類回饋進行強化學習 (RLHF)
一種使用人類偏好訊號來塑造模型行為的訓練方法。
培訓後
預訓練後應用的訓練步驟,例如指令調整、偏好最佳化和安全調整。
持續學習
讓模型不斷從新資料中學習而不忘記先驗知識的訓練方法。
微調
對特定領域的資料進行持續訓練,以使預先訓練的模型適應特定任務。
梯度下降
一種向減少誤差的方向更新參數的最佳化方法。
指令調優
微調指令-響應對的模型以改善任務追蹤。
在我們的免費指南中了解更多信息
AI Inference Optimization
Bidirectional Recurrent Networks
Second-Order Optimization and Newton Methods
Odds Ratio Preference Optimization
參見
Tree of Thoughts
QLoRA
ReAct
Flash Attention
Agentic Loop
Multi-Head Attention
MCP (Model Context Protocol)
Positional Encoding
Previous
Tree of Thoughts
Next
QLoRA
瀏覽完整的人工智慧術語表
探索所有免費的人工智慧指南