跳至內容
學習新聞工具職缺使命
捐款
從這裡開始開始學習
學習
前往 學習課程指南AI 導師提示庫測驗認證術語表
新聞
前往 新聞最新人工智慧新聞主題追蹤器研究和數據集部落格編輯準則更正說明
工具
前往 工具工具目錄最佳名單比較工具成本計算器快速精煉機提交工具
職缺
前往 職缺瀏覽人工智慧職位發布職缺贊助美亞保險
使命
前往 使命使命影響和統計作者幫助中心有什麼新消息支援
捐款
首頁/詞彙表/根據人類回饋進行強化學習 (RLHF)
人工智慧術語

什麼是根據人類回饋進行強化學習 (RLHF)?

定義

一種使用人類偏好訊號來塑造模型行為的訓練方法。

相關術語

強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
獎勵模式
一種根據偏好訊號對輸出進行評分的模型,通常用於 RLHF 管道。
DPO(直接偏好優化)
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
持續學習
讓模型不斷從新資料中學習而不忘記先驗知識的訓練方法。
少樣本學習
僅從少量範例中學習或適應行為。
模型漂移
由於現實條件與訓練假設存在差異,表現會隨著時間的推移而下降。

在我們的免費指南中了解更多信息

Deep LearningReinforcement LearningMachine Learning BasicsSupervised Learning

參見

RetrievalRed TeamingRecommendation SystemRobustnessRecallSafety FilterRAG (Retrieval-Augmented Generation)Scaling Law
PreviousReinforcement LearningNextRetrieval
瀏覽完整的人工智慧術語表探索所有免費的人工智慧指南
獨立的。打開。對於每個人來說。

免費人工智慧教育。 對於每個人、任何地方。

AI教育保持免費。一個 501(c)(3) 非營利組織,向公眾教授人工智慧如何實際工作以及如何很好地使用它。

開始免費學習支持我們的使命

一點清晰度。在您的收件匣中。

本週最有用的人工智慧新聞、工具、學習精選和機會。訊號清晰,無垃圾訊息。

沒有垃圾郵件。一鍵取消訂閱。隱私權政策

熱門指南
  • 什麼是人工智慧
  • ChatGPT 與大型語言模型
  • Prompt Engineering
  • 生成式 AI
  • AI 圖像生成
  • AI 倫理
  • AI 的未來

01學習

  • 課程
  • 全部指南
  • 詞彙表
  • 測驗
  • 認證

02資源

  • 新聞
  • 部落格
  • 電子報
  • AI 工具目錄
  • 工具比較
  • 人工智能成本计算器
  • 提示庫
  • 人工智慧就業委員會
  • AI 統計數據
  • 研究和數據集
  • 提交工具

03關於機構

  • 使命
  • 贊助
  • 捐款
  • 幫助中心
  • 什麼是新的
  • 回報問題

04法律條款

  • 安全性
  • 隱私權政策
  • Cookie 政策
  • 使用條款
  • 捐款人政策
  • 所有合法頁面
  • 網站地圖

05帳戶

  • 登入
  • 註冊
  • 提交工具

© 2026 AI Understanding501(c)(3) 公益慈善機構EIN 41-3273048

編輯準則更正說明資金與揭露聯絡我們