跳至內容
學習新聞工具職缺使命
捐款
從這裡開始開始學習
學習
前往 學習課程指南AI 導師提示庫測驗認證術語表
新聞
前往 新聞最新人工智慧新聞主題追蹤器研究和數據集部落格編輯準則更正說明
工具
前往 工具工具目錄最佳名單比較工具成本計算器快速精煉機提交工具
職缺
前往 職缺瀏覽人工智慧職位發布職缺贊助美亞保險
使命
前往 使命使命影響和統計作者幫助中心有什麼新消息支援
捐款
首頁/詞彙表/獎勵模式
人工智慧術語

什麼是 獎勵模式?

定義

一種根據偏好訊號對輸出進行評分的模型,通常用於 RLHF 管道。

相關術語

根據人類回饋進行強化學習 (RLHF)
一種使用人類偏好訊號來塑造模型行為的訓練方法。
強化學習
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
地面真相
用於訓練或評估模型輸出的可信參考標籤。
DPO(直接偏好優化)
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
訓練中期
預訓練和訓練後之間的中間訓練階段,通常用於能力或領域調整。
人工智慧代理
一種可以觀察、推理並採取行動來實現目標的軟體系統,通常使用工具和記憶體。

在我們的免費指南中了解更多信息

AI Models ExplainedModel CollapseModel LifecycleModel Context Protocol

參見

RetrievalRobustnessSafety FilterScaling LawRed TeamingSemantic SearchRecommendation SystemSelf-Supervised Learning
PreviousRetrievalNextRobustness
瀏覽完整的人工智慧術語表探索所有免費的人工智慧指南
AI Understanding

免費人工智慧教育。 對於每個人、任何地方。

AI教育保持免費。一個 501(c)(3) 非營利組織,向公眾教授人工智慧如何實際工作以及如何很好地使用它。

開始免費學習支持我們的使命
一點清晰度。在您的收件匣中。

沒有垃圾郵件。一鍵取消訂閱。隱私權政策

學習

  • 課程
  • 全部指南
  • 什麼是人工智慧
  • ChatGPT 與大型語言模型
  • Prompt Engineering
  • 生成式 AI
  • AI 圖像生成
  • AI 倫理
  • AI 的未來
  • 詞彙表
  • 測驗
  • 認證

資源

  • 新聞
  • 部落格
  • 電子報
  • AI 工具目錄
  • 工具比較
  • 人工智能成本计算器
  • 提示庫
  • 人工智慧就業委員會
  • AI 統計數據
  • 研究和數據集
  • 提交工具

關於機構

  • 使命
  • 編輯準則
  • 更正說明
  • 贊助
  • 捐款
  • 幫助中心
  • 什麼是新的
  • 聯絡我們
  • 回報問題

法律條款

  • 安全性
  • 隱私權政策
  • Cookie 政策
  • 使用條款
  • 資訊揭露
  • 捐款人政策
  • 所有合法頁面
  • 網站地圖

帳戶

  • 登入
  • 註冊
  • 提交工具
  • 服務狀態501(c)(3) 公益慈善機構在法律允許的範圍內,捐款在美國可以免稅。
  • EIN41-3273048IRS 雇主識別號碼。
  • 訪問開放取用核心學習沒有廣告,也沒有付費牆。
  • 聯絡我們[email protected]問題、更正和新聞。

© 2026 AI Understanding. 保留一切權利。

編輯準則更正說明資金與揭露聯絡我們