卡尼曼-特沃斯基优化
Kahneman-Tversky Optimization (KTO) 是一种对齐方法,它从简单的赞成或反对标签而不是配对比较中学习。
概述
It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.
深入探讨
KTO 是由 Ethayarajh 及其同事在斯坦福大学和 Contextual AI 于 2024 年推出的,它借鉴了前景理论,这是 Daniel Kahneman 和 Amos Tversky 的诺贝尔奖获奖作品,关于人类如何评估得失。像 DPO 这样的标准方法需要偏好对:针对同一提示选择的答案和拒绝的答案。相反,KTO 使用不成对的数据,其中每个单独的输出都被简单地标记为所需或不需要。它构建了一种人类感知的损失,将模型对样本的改进视为相对于参考点的增益或损失,应用损失厌恶,因此对不期望的输出的惩罚比期望的输出的奖励更严厉。这使得团队可以使用生产应用程序中已收集的大量赞成/反对信号。
技术洞察
KTO 定义了一个基于前景理论建模的价值函数,衡量响应的隐含奖励高于或低于参考基线(通常是与参考政策的平均 KL 散度)的程度。理想的例子推高价值,不理想的例子推低价值,损失厌恶系数使负偏差更重。至关重要的是,每个示例只需要一个标签,而不是匹配对。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
Kahneman-Tversky 优化的未来
KTO 非常适合真实产品,用户会自然地点击喜欢或不喜欢,但很少并排排列两个答案。预计回收生产反馈的持续改进循环将得到更广泛的采用,再加上研究调整所需数据与不需要数据的比率和损失厌恶权重。当团队寻求从混乱的现实世界信号中寻求一致性时,将 KTO 的行为经济学框架与其他目标相结合,并将其应用于多模式反馈,是积极的方向。
现实世界的实施
使用已部署的聊天机器人的“拇指向上/拇指向下”点击来对其进行微调,而无需构建偏好对
当您有一堆“好”和“坏”答案但没有针对相同提示的匹配比较时对齐模型
产品团队将审核标记(不需要)和保存的响应(需要)回收到 KTO 培训中
通过调整 KTO 的损失厌恶和类别权重,处理不喜欢的反馈比喜欢少的不平衡反馈
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Kahneman-Tversky Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Kahneman-Tversky Optimization?
Kahneman-Tversky Optimization (KTO) 是一种对齐方法,它从简单的赞成或反对标签而不是配对比较中学习。这很重要,因为二进制反馈比大多数方法所需的排名对更容易收集,也更便宜。
KTO 需要什么样的数据?
KTO 从简单的每个示例的赞成/反对标签中学习,而不是从匹配的偏好对中学习。
KTO 的灵感来自于哪些作品?
KTO借用了前景理论的不对称评估收益和损失的思想,因此得名。
KTO 中使用的“损失厌恶”是什么?
前景理论认为,损失比收益更大,因此 KTO 更重视负偏差。
与DPO相比,KTO在你有什么的时候特别有用?
当反馈是不成对的二进制信号时,KTO 会发挥作用,产品比排名对更容易收集这些信号。
在 KTO 中,偏差是相对于什么来测量的?
KTO 的价值函数判断响应是否高于或低于参考基线,并将其视为收益或损失。