語言人工智慧指南

比值比偏好優化

比值比偏好最佳化 (ORPO) 是一種微調方法,可在單次訓練中教會語言模型良好的行為和人類偏好。

閱讀時間約2分鐘最後更新

概述

這很重要,因為它跳過了通常的單獨獎勵模型和參考模型,使對齊更便宜、更簡單。

深入探討

ORPO 由 Hong、Lee 和 Thorne 於 2024 年提出,將監督微調和偏好調整合而為一。大多數對齊管道首先對好的範例進行 SFT,然後運行第二種方法,例如 RLHF 或 DPO,該方法需要模型的凍結副本(參考)以及儲存的偏好對。 ORPO 完全刪除了參考模型。它的損失為標準的下一個令牌目標增加了一個懲罰項:它提高了模型分配給所選(首選)回應的幾率,同時降低了拒絕回應的幾率。因為它使用優勢比而不是強大的對數機率差距,所以懲罰很溫和,因此模型學會了支持好的答案,而不會災難性地忘記流暢的生成。

技術洞察

ORPO 的損失是 SFT 交叉熵損失加上所選響應和拒絕響應之間對數優勢比的加權對數 sigmoid。賠率等於 p/(1-p),因此該比率會比較模型找到好答案與壞答案的可能性有多大。使用賠率而不是原始機率可以保持對比溫和,從而防止過度抑制被拒絕的標記,從而降低未引用模型的性能。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

比值比偏好優化的未來

ORPO 越來越受歡迎,因為它透過放棄參考模型來減少記憶體和運算量,這對於在有限硬體上進行微調的團隊很有吸引力。預計它將更頻繁地出現在開源食譜中,並作為 Hugging Face TRL 等庫的預設選項。未來的工作可能會自動調整 lambda 權重,將 ORPO 與其他無參考目標混合,並將其擴展到多模式和非常大的模型,在這些模型中,在記憶體中保存兩個副本的成本很高。

現實世界的實施

在偏好對上微調開源 7B 聊天模型,無需載入第二個參考副本,從而將 GPU 記憶體減半

一家新創公司將客戶支援助理調整為在一次培訓中更喜歡禮貌、符合政策的答案,而不是 SFT-then-DPO

研究人員在同一資料集上將 ORPO 與 DPO 進行比較,以顯示較低計算量的可比較一致性

將基本模型調整到專門領域(例如法律起草),其中可以使用好的和壞的範例對,但沒有獎勵模型預算

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

直接偏好優化

常見問題

什麼是優勢比偏好優化?

比值比偏好最佳化 (ORPO) 是一種微調方法,可在單次訓練中教會語言模型良好的行為和人類偏好。這很重要,因為它跳過了通常的單獨獎勵模型和參考模型,使對齊更便宜、更簡單。

與 DPO 等方法相比,ORPO 的主要實際優勢是什麼?

ORPO 將偏好學習納入 SFT 損失中,不需要模型的凍結參考副本,從而節省了記憶體和計算量。

ORPO 中的「比值比」有何不同?

ORPO 使用模型分配給首選答案與不首選答案的優勢比 (p/(1-p))。

ORPO 在一次訓練中執行哪兩項任務?

ORPO 將標準 SFT 下一個代幣目標與偏好懲罰結合在一個統一的損失中。

為什麼 ORPO 使用賠率而不是原始對數機率差來進行處罰?

基於賠率的懲罰較為溫和,有助於未引用模型保持流暢的生成,同時仍然更喜歡好的答案。

ORPO 損失最好描述為哪一種組合?

ORPO 在監督交叉熵損失的基礎上添加了加權對數 sigmoid 優勢比項。