跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
首頁
/
詞彙表
/
根據人類回饋進行強化學習 (RLHF)
人工智慧術語
什麼是
根據人類回饋進行強化學習 (RLHF)
?
定義
一種使用人類偏好訊號來塑造模型行為的訓練方法。
相關術語
強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
獎勵模式
一種根據偏好訊號對輸出進行評分的模型,通常用於 RLHF 管道。
DPO(直接偏好優化)
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
持續學習
讓模型不斷從新資料中學習而不忘記先驗知識的訓練方法。
少樣本學習
僅從少量範例中學習或適應行為。
模型漂移
由於現實條件與訓練假設存在差異,表現會隨著時間的推移而下降。
在我們的免費指南中了解更多信息
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
參見
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
瀏覽完整的人工智慧術語表
探索所有免費的人工智慧指南