基礎知識指南

偏好優化中的長度標準化

長度標準化調整了偏好調整目標,因此模型不再僅僅透過編寫更長的答案來贏得認可。

閱讀時間約2分鐘最後更新

概述

It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.

深入探討

當模型與 RLHF 或 DPO 等方法保持一致時,它們會從人類(或獎勵模型)選擇兩個答案中「更好」的比較中學習。一個持續存在的錯誤是,較長的答案往往會受到青睞,即使它們實際上並不更好,因此模型學習了捷徑:冗長。長度標準化可以抵消這一點。在 DPO 中,隱含獎勵是每個令牌對數機率差異的總和,它會隨著長度機械地增長。長度歸一化 DPO 和 SimPO 等變體將獎勵除以代幣數量,而是按每個代幣的平均值進行評分。結果是模型保持簡潔和切題,而不是誇大對遊戲目標的反應。

技術洞察

DPO 的隱式獎勵是調整策略和參考策略之間的對數比,對回應中的每個令牌求和。因為每個令牌都會添加另一個(通常是正數)項,所以原始獎勵會隨著序列長度而縮放,從而使最佳化偏向於更長的完成時間。 SimPO 放棄了參考模型,並使用每個代幣的平均對數機率作為獎勵,加上目標獎勵幅度。除以長度消除了機械長度優勢,因此偏好梯度反映的是質量而不是字數。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

偏好優化中長度標準化的未來

預計長度控制將成為標準旋鈕,而不是事後的想法。研究人員正在將長度標準化與明確的長度懲罰、長度條件獎勵和保持答案長度恆定的評估套件相結合,以衡量真實的品質增益。隨著獎勵模型在發現冗長偏差方面變得更好,對齊管道可能會預設報告長度偏差的獲勝率,並且用戶將更好地控制模型答案的簡潔或詳細程度。

現實世界的實施

使用 SimPO 調整客戶支援助理,使其給出清晰、準確的答复,而不是看起來詳盡的填充段落。

報告 AlpacaEval 2 上的“長度控制勝率”,以表明模型得到了真正的改進,而不僅僅是變得更喋喋不休。

在微調編碼模型時向 DPO 添加長度標準化,以便它返回最少的正確片段,而不是臃腫的樣板。

診斷一個獎勵模型,該模型可以系統地為較長的論文評分更高,然後在使用它來調整寫作助理之前對其進行消除偏差。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄偏好優化中長度歸一化的哪些方面有幫助以及哪些更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

比值比偏好優化

常見問題

What is Length Normalization in Preference Optimization?

長度標準化調整了偏好調整目標,因此模型不再僅僅透過編寫更長的答案來贏得認可。這很重要,因為未經糾正的獎勵訊號會促使聊天機器人做出冗長、填充的回應,而不是真正更好的回應。

DPO 中的長度標準化主要旨在防止哪些不良行為?

DPO 的隱性獎勵隨著代幣數量的增加而增長,因此如果沒有標準化模型,就知道簡單地更冗長往往會贏得偏好比較。

為什麼標準 DPO 的隱性獎勵往往會隨著反應長度的增加而增加?

隱式獎勵將每個代幣的對數機率比相加,因此更多的代幣通常意味著更大的總獎勵。

SimPO 如何解決長度偏差?

SimPO 透過平均(長度歸一化)對數機率對反應進行評分,並增加目標獎勵裕度,消除機械長度優勢。

哪種評估實踐有助於確認模型品質的提高而不僅僅是長度的提高?

長度控制的勝率(如 AlpacaEval 2)根據答案長度進行調整,因此收益反映了質量,而不是冗長。