語言人工智慧指南

卡尼曼-特沃斯基優化

Kahneman-Tversky Optimization (KTO) 是一種對齊方法,它從簡單的贊成或反對標籤而不是配對比較中學習。

閱讀時間約2分鐘最後更新

概述

It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.

深入探討

KTO 是由 Ethayarajh 及其同事在史丹佛大學和 Contextual AI 於 2024 年推出的,它藉鑒了前景理論,這是 Daniel Kahneman 和 Amos Tversky 的諾貝爾獎獲獎作品,關於人類如何評估得失。像 DPO 這樣的標準方法需要偏好對:針對相同提示選擇的答案和拒絕的答案。相反,KTO 使用不成對的數據,其中每個單獨的輸出都被簡單地標記為所需或不需要。它建構了一種人類感知的損失,將模型對樣本的改進視為相對於參考點的增益或損失,應用損失厭惡,因此對不期望的輸出的懲罰比期望的輸出的獎勵更嚴厲。這使得團隊可以使用生產應用程式中已收集的大量贊成/反對訊號。

技術洞察

KTO 定義了一個基於前景理論建模的價值函數,衡量反應的隱含獎勵高於或低於參考基線(通常是與參考政策的平均 KL 散度)的程度。理想的例子推高價值,不理想的例子推低價值,損失厭惡係數使負偏差更重。至關重要的是,每個範例只需要一個標籤,而不是匹配對。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

Kahneman-Tversky 優化的未來

KTO 非常適合真實產品,使用者會自然地點擊喜歡或不喜歡,但很少並排排列兩個答案。預計回收生產回饋的持續改善循環將得到更廣泛的採用,再加上研究調整所需數據與不需要數據的比率和損失厭惡權重。當團隊尋求從混亂的現實世界訊號中尋求一致性時,將 KTO 的行為經濟學框架與其他目標結合,並將其應用於多模式回饋,是積極的方向。

現實世界的實施

使用已部署的聊天機器人的“拇指向上/拇指向下”點擊來對其進行微調,而無需構建偏好對

當您有一堆“好”和“壞”答案但沒有針對相同提示的匹配比較時對齊模型

產品團隊將審核標記(不需要)和保存的回應(需要)回收到 KTO 培訓中

透過調整 KTO 的損失厭惡和類別權重,處理不喜歡的回饋比喜歡少的不平衡回饋

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kahneman-Tversky Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

直接偏好優化

常見問題

What is Kahneman-Tversky Optimization?

Kahneman-Tversky Optimization (KTO) 是一種對齊方法,它從簡單的贊成或反對標籤而不是配對比較中學習。這很重要,因為二進制回饋比大多數方法所需的排名對更容易收集,也更便宜。

KTO 需要什麼樣的數據?

KTO 從簡單的每個範例的贊成/反對標籤中學習,而不是從匹配的偏好對中學習。

KTO 的靈感來自於哪些作品?

KTO借用了前景理論的不對稱評估收益和損失的思想,因此得名。

KTO 中使用的「損失厭惡」是什麼?

前景理論認為,損失比收益更大,因此 KTO 更重視負偏差。

與DPO相比,KTO在你有什麼的時候特別有用?

當回饋是不成對的二元訊號時,KTO 會發揮作用,產品比排名對更容易收集這些訊號。

在 KTO 中,偏差是相對於什麼來測量的?

KTO 的價值函數判斷反應是否高於或低於參考基線,並將其視為收益或損失。