跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
首頁
/
詞彙表
/
強化學習
人工智慧術語
什麼是
強化學習
?
定義
透過獎勵訊號進行訓練,代理學習能夠最大化長期回報的行動。
相關術語
根據人類回饋進行強化學習 (RLHF)
一種使用人類偏好訊號來塑造模型行為的訓練方法。
獎勵模式
一種根據偏好訊號對輸出進行評分的模型,通常用於 RLHF 管道。
人工智慧代理
一種可以觀察、推理並採取行動來實現目標的軟體系統,通常使用工具和記憶體。
憲法人工智慧
一種訓練和行為塑造方法,其中模型輸出由一組固定的書面原則指導。
代理循環
人工智慧代理觀察、計劃、行動和反思的迭代循環,直到完成目標或達到停止條件。
DPO(直接偏好優化)
一種直接在偏好對上微調模型的訓練方法,無需單獨的獎勵模型。
在我們的免費指南中了解更多信息
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
參見
Red Teaming
Recommendation System
Retrieval
Recall
RAG (Retrieval-Augmented Generation)
Robustness
Quantization
Safety Filter
Previous
Red Teaming
Next
Reinforcement Learning from Human Feedback (RLHF)
瀏覽完整的人工智慧術語表
探索所有免費的人工智慧指南