基礎知識指南

迭代 DPO 和線上偏好調整

迭代 DPO 透過產生新的回應、對它們進行排名以及每輪對這些新的對進行調整,反覆將語言模型與人類或人工智慧的偏好保持一致。

閱讀時間約2分鐘最後更新

概述

It matters because static, one-shot preference data goes stale, while iterating keeps the training signal on-policy and the model improving.

深入探討

直接偏好優化 (DPO) 跳過訓練單獨的獎勵模型:給定一對首選和拒絕的響應,它使用從 RLHF 目標導出的簡單分類式損失直接調整策略,以提高所選答案相對於被拒絕答案的可能性。問題是普通 DPO 在固定的、通常脫離策略的資料集上進行訓練,因此模型可能會過度擬合舊的比較。迭代(線上)DPO 閉合循環:當前模型對新響應進行採樣,法官(人類或強大的 AI/獎勵模型)標記哪個更好,然後您對這些新數據運行另一輪 DPO。重複幾次此操作會產生一個追蹤模型實際行為的移動目標,通常可以匹配或擊敗基於 PPO 的 RLHF,但複雜性要低得多。

技術洞察

DPO 的損失使用參考模型(通常是 SFT 檢查點)和類似溫度的 beta 來控制偏差,有效地編碼等於策略機率和參考機率之間的對數比的隱式獎勵。上線很重要,因為從目前政策中採樣的偏好資料保持分佈狀態,從而減少了困擾線下 DPO 的分佈變化。每次迭代都會重新產生補全,重新標記偏好,並可選擇刷新參考模型,因此梯度始終反映當前的弱點。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

迭代 DPO 和線上偏好調整的未來

預計偏好調整將變得越來越自動化和連續,人工智慧法官和獎勵模型可大規模提供標籤,因此迭代循環的運作成本較低。 KTO、IPO 和長度控製或自我獎勵 DPO 等變體正在改善損失,以遏制冗長和獎勵駭客行為。更廣泛的趨勢是將產生、判斷和更新更緊密地整合到管道中,不斷調整前緣模型,減少每一步的人工標記。

現實世界的實施

在多輪中調整聊天助手,每次都會對新回應進行採樣並對它們重新排名以提高幫助性

自我獎勵設置,模型產生並判斷自己的響應對以引導更好的偏好數據

建立原始品質後,透過在後續迭代中添加長度控制的 DPO 來減少答案的冗長

領域適應,例如根據測試結果判斷的新生成的解決方案對迭代調整編碼模型

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄迭代 DPO 和線上偏好調整在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Iterative DPO and Online Preference Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

偏好優化中的長度標準化

常見問題

What is Iterative DPO and Online Preference Tuning?

迭代 DPO 透過產生新的回應、對它們進行排名以及每輪對這些新的對進行調整,反覆將語言模型與人類或人工智慧的偏好保持一致。這很重要,因為靜態的一次性偏好資料會變得陳舊,而迭代可以保持訓練訊號符合策略並且模型得到改進。

DPO 避免了傳統 RLHF (PPO) 要求的哪些內容?

DPO 直接從偏好對最佳化策略,消除了基於 PPO 的 RLHF 使用的單獨獎勵模型和 RL 循環。

為什麼迭代(線上)DPO 通常比在固定資料集上運行一次 DPO 更好?

每輪重新產生和重新標記反應可以使數據與當前策略保持一致,從而減少分佈變化和對陳舊比較的過度擬合。

參考模型在 DPO 損失中扮演什麼角色?

DPO 比較策略和參考對數機率;此比率充當隱性獎勵並限制政策漂移的程度。

在線上 DPO 的單次迭代中,典型的順序是什麼?

每個循環都會從當前模型產生新的完成,由法官對它們進行排名,並對新對應用 DPO 更新。

DPO中的beta超參數控制什麼?

Beta 的作用就像隱性獎勵的溫度,在接近參考值和適應偏好之間進行權衡。