跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
首頁
/
詞彙表
/
獎勵模式
人工智慧術語
什麼是
獎勵模式
?
定義
一種根據偏好訊號對輸出進行評分的模型,通常用於 RLHF 管道。
相關術語
根據人類回饋進行強化學習 (RLHF)
一種使用人類偏好訊號來塑造模型行為的訓練方法。
強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
地面真相
用於訓練或評估模型輸出的可信參考標籤。
DPO(直接偏好優化)
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
訓練中期
預訓練和訓練後之間的中間訓練階段,通常用於能力或領域調整。
人工智慧代理
一種可以觀察、推理並採取行動來實現目標的軟體系統,通常使用工具和記憶體。
在我們的免費指南中了解更多信息
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
參見
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
瀏覽完整的人工智慧術語表
探索所有免費的人工智慧指南