技術指南

從人類回饋中強化學習

RLHF 是一種透過根據人類偏好進行訓練,將原始語言模型轉變為有用、有禮貌的助手的技術。

閱讀時間約2分鐘最後更新

概述

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

深入探討

預先訓練的語言模型可以預測合理的文本,但合理不等於有幫助、誠實或安全。 RLHF 分階段解決了這個問題。首先,監督微調教導模型遵循使用人工編寫的範例答案的指令。接下來,人類會比較模型對相同提示的反應,並選擇更好的一個;這些比較訓練了一個單獨的獎勵模型,可以對任何回應進行評分。最後,透過強化學習對語言模型進行最佳化,以產生獎勵模型評價較高的反應。懲罰可以防止它偏離原始模型太遠,因此它可以保持流暢並且不會利用獎勵模型的怪癖。 RLHF 是使 ChatGPT 風格的助手可用的核心。

技術洞察

獎勵模型通常在具有 Bradley-Terry 風格損失的偏好對上進行訓練,學習為人類偏好的答案提供更高的標量分數。然後使用 PPO(近端策略優化)更新策略,最大限度地提高獎勵,同時針對參考模型的 KL 散度懲罰可防止過度優化和「獎勵駭客」。由於 PPO 非常繁瑣,因此 DPO(直接偏好優化)等新方法跳過了顯式獎勵模型和強化循環,直接從偏好對最佳化策略。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

根據人類回饋強化學習的未來

RLHF 正在簡化並部分自動化。 DPO 和相關的直接偏好方法正在取代許多團隊繁重的 PPO 流程,而 RLAIF 使用人工智慧產生的回饋(如憲法人工智慧)來降低標籤成本。研究正在透過過程監督和辯論等技術來解決獎勵駭客、註釋者偏見以及判斷長篇或專家回應的困難。期望能夠融合人類和人工智慧的回饋,獲得比單一豎起大拇指更豐富的獎勵訊號,以及對誰提供偏好以及他們編碼的價值進行日益嚴格的審查。

現實世界的實施

調整聊天助手,使其拒絕有害的請求,並提供有用的、結構良好的答案,而不僅僅是看似合理的文字。

根據人們的偏好對摘要對進行排名,以訓練一個模型,該模型可以編寫人們實際上認為有用的摘要。

透過獎勵人類評估者認為尊重和安全的反應來減少有毒或有偏見的輸出。

在首選答案與拒絕答案的資料集上使用 DPO 來調整開源模型,而無需執行完整的 PPO 循環。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Reinforcement Learning From Human Feedback?

RLHF 是一種透過根據人類偏好進行訓練,將原始語言模型轉變為有用、有禮貌的助手的技術。這很重要,因為它將模型行為與人們的實際想要的東西結合起來,而不僅僅是統計上可能的東西。

RLHF 對於語言模型的主要目的是什麼?

RLHF 引導模型朝著人類喜歡的反應方向發展,使其更加有用、誠實和安全,而不僅僅是看似合理。

RLHF 中的獎勵模型實際上是用來做什麼的?

獎勵模型根據人類偏好比較進行訓練,以對反應進行評分,從而提供策略優化的訊號。

為什麼在 RL 步驟中使用針對原始模型的 KL 散度懲罰?

KL 懲罰使最佳化策略接近參考模型,防止獎勵駭客和流暢性損失。

通常如何為獎勵模型收集偏好資料?

註釋者在成對比較中選擇首選反應,透過 Bradley-Terry 式損失來訓練獎勵模型。

與經典的 RLHF 管道相比,DPO(直接偏好優化)有何優點?

DPO 直接從偏好中得出目標,避免了單獨的獎勵模型和繁瑣的強化學習步驟。