跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
← 回傳所有測驗
引導式測驗 • 中等 等級 • 6 問題
迭代 DPO 和線上偏好調整測驗
檢查您對迭代和線上偏好優化如何改進語言模型的掌握。
相關引導路徑
迭代 DPO 和線上偏好調整
問題 1 的 6
DPO 避免了傳統 RLHF (PPO) 要求的哪些內容?
需要提示嗎?
A
任何訓練數據
B
訓練單獨的顯性獎勵模型
C
使用神經網絡
D
完全是人類的喜好