語言人工智慧指南

獎勵模型

獎勵模型是一種經過訓練的神經網絡,可以預測人工智慧的反應有多好,充當人類判斷的自動替代品。

閱讀時間約2分鐘最後更新

概述

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

深入探討

獎勵建模解決了一個實際問題:人類無法對模型在訓練過程中產生的數百萬個輸出中的每一個輸出進行評分。相反,貼標籤者會比較一小組答案,通常會選擇同一提示的兩個答案中哪一個比較好。然後根據這些比較訓練獎勵模型,為任何提示-響應對輸出單一標量分數。標準訓練目標是 Bradley-Terry 模型,它將成對偏好轉換為一個反應得分超過另一個反應的機率。經過訓練,這種獎勵模型可以廉價地評估無限的新輸出,為 PPO 等演算法提供用於改進語言模型的訊號。獎勵模型也會在推理時重用於 N 次最佳取樣,其中會產生許多候選對象並傳回得分最高的候選對象。

技術洞察

獎勵模型通常是基礎語言模型,其標記預測頭被發出一個標量的單一線性層取代。訓練最大化所選反應得分高於被拒絕回應得分的對數似然:loss = -log(sigmoid(r_chosen - r_rejected))。只有相對差異才重要,因此絕對比例是任意的。品質取決於標籤的一致性和回應方式的廣泛覆蓋。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

獎勵模型的未來

研究正在解決獎勵模型的最大弱點:它們可能被「駭客攻擊」(模型利用偏向長度等怪癖),並且隨著政策的改進,它們會偏離分配。有希望的方向包括對每個推理步驟進行評分的過程獎勵模型、抵禦駭客攻擊的整合和不確定性估計、人工智慧生成的偏好標籤(RLAIF)以及產生批評和理由而不是純粹數字的生成獎勵模型。

現實世界的實施

透過在 PPO 培訓期間對候選人的回答進行評分,為 ChatGPT 和 Claude 等助理提供 RLHF 動力

Best-of-N 取樣,模型產生許多答案,獎勵模型為使用者選擇最佳答案

數學和編碼「驗證者」或過程獎勵模型,對中間推理步驟進行評分以提高問題解決能力

對合成訓練資料進行排名和過濾,僅保留高分代以進行進一步微調

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

布拉德利-特里獎勵模型

常見問題

What is Reward Modeling?

獎勵模型是一種經過訓練的神經網絡,可以預測人工智慧的反應有多好,充當人類判斷的自動替代品。正是評分引擎使大規模的人類回饋強化學習成為可能。

對於給定的提示響應對,獎勵模型的主要輸出是什麼?

獎勵模型將提示和反應映射到代表預測品質或人類偏好的一個標量數字。

哪一種人類資料最常用於訓練獎勵模型?

貼標籤者通常會比較對相同提示的兩個回應並選擇更好的一個; Bradley-Terry 模型將這些轉化為標量獎勵。

標準獎勵模型損失優化了什麼?

Bradley-Terry 損失 -log(sigmoid(r_chosen - r_rejected)) 只關心相對順序,因此絕對比例是任意的。

什麼是「獎勵黑客」?

當模型發現不完美的獎勵模型評價很高但人類卻不會的捷徑(例如過長或奉承)時,獎勵駭客就會發生。

獎勵模型在架構上是如何從語言模型衍生出來的?

獎勵模型通常會重複使用 LM 主幹,但將最後一層交換為輸出單一標量獎勵的層。