語言人工智慧指南

直接偏好優化

直接偏好最佳化(DPO)是一種使語言模型與人類偏好保持一致的方法,無需訓練單獨的獎勵模型或運行強化學習。

閱讀時間約2分鐘最後更新

概述

它將複雜的多級管道分解為單一穩定的訓練損失。

深入探討

Rafailov 和史丹佛大學的同事於 2023 年推出的 DPO 重新思考了我們如何教導人們喜歡的模式。傳統方法(RLHF)根據人類比較訓練獎勵模型,然後使用強化學習來最大化獎勵。 DPO 的關鍵見解是數學上的:RLHF 目標下的最優策略與獎勵具有封閉形式的關係,因此您可以重新排列方程式並直接在偏好對上優化語言模型。你給它一個提示、一個「選擇」(首選)回應和一個「拒絕」回應,一個簡單的分類式損失會推動模型,使所選答案相對更有可能。沒有獎勵模型,沒有採樣循環,沒有獎勵黑客。運作起來更簡單、更穩定。

技術洞察

DPO 對偏好對使用二元交叉熵損失。它增加了所選響應相對於被拒絕響應的對數機率比,每個響應都是針對凍結的參考模型(通常是監督微調的起點)進行測量的。溫度參數 beta 控制策略可能偏離此參考值的程度,隱性強制執行 RLHF 明確應用的 KL 約束。回報永遠不會實現;它隱含在策略本身的對數機率中。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

直接偏好優化的未來

DPO 已成為預設的對齊方法,因為它便宜且可重複,並且它產生了一系列變體:IPO 修復了對近乎確定性偏好的過度擬合,KTO 從單個好或壞標籤而不是對中學習,ORPO 將偏好學習折疊到沒有參考模型的微調中。預計將繼續致力於將 DPO 與保單數據和長度/品質去偏差相結合,從而縮小與完整線上 RLHF 的剩餘差距。

現實世界的實施

微調開放權重聊天模型,例如 Zephyr 以及許多 Llama 和 Mistral 衍生品,這些模型與偏好資料集上的 DPO 保持一致

使用配對減少有害或無益的輸出,其中「選擇」安全、有用的答案而不是有問題的答案

使用開發人員評分的比較,教導編碼助理更喜歡正確的、有詳細記錄的解決方案,而不是有缺陷的解決方案

調整摘要風格,使模型更喜歡簡潔、忠實的摘要,而不是冗長或幻覺的摘要

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

比值比偏好優化

常見問題

什麼是直接偏好優化?

直接偏好最佳化(DPO)是一種使語言模型與人類偏好保持一致的方法,無需訓練單獨的獎勵模型或運行強化學習。它將複雜的多級管道分解為單一穩定的訓練損失。

與傳統的 RLHF 相比,DPO 消除了什麼?

DPO 的主要優點是移除了明確獎勵模型和 RL 採樣循環,而是直接在偏好對上最佳化策略。

單一 DPO 訓練範例包含哪些資料?

DPO 在偏好對上進行訓練:一個提示加上一個首選(「選擇」)和一個不喜歡(「拒絕」)回應。

參考模型在 DPO 中發揮什麼作用?

凍結參考(通常是 SFT 模型)錨定損失; beta 參數控制訓練後的策略可以偏離它多遠。

在DPO中,「獎勵」體現在哪裡?

DPO 的推導顯示獎勵隱含在策略和參考之間的對數機率比中,因此不需要明確的獎勵模型。

DPO 中的 beta(溫度)參數控制什麼?

Beta 控制隱式 KL 約束:較高的 Beta 使策略更接近參考值,較低的 Beta 允許更大的偏差。