奖励模型
奖励模型是一种经过训练的神经网络,可以预测人工智能的反应有多好,充当人类判断的自动替代品。
概述
It is the scoring engine that makes reinforcement learning from human feedback possible at scale.
深入探讨
奖励建模解决了一个实际问题:人类无法对模型在训练过程中生成的数百万个输出中的每一个进行评分。相反,贴标签者会比较一小组答案,通常会选择同一提示的两个答案中哪一个更好。然后根据这些比较训练奖励模型,为任何提示-响应对输出单个标量分数。标准训练目标是 Bradley-Terry 模型,它将成对偏好转化为一个响应得分超过另一个响应的概率。经过训练,这种奖励模型可以廉价地评估无限的新输出,为 PPO 等算法提供用于改进语言模型的信号。奖励模型也会在推理时重用于 N 次最佳采样,其中会生成许多候选对象并返回得分最高的候选对象。
技术洞察
奖励模型通常是基础语言模型,其标记预测头被发出一个标量的单个线性层取代。训练最大化所选响应得分高于被拒绝响应得分的对数似然:loss = -log(sigmoid(r_chosen - r_rejected))。只有相对差异才重要,因此绝对比例是任意的。质量取决于标签的一致性和响应方式的广泛覆盖。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
奖励模型的未来
研究正在解决奖励模型的最大弱点:它们可能被“黑客攻击”(模型利用偏向长度等怪癖),并且随着政策的改进,它们会偏离分配。有希望的方向包括对每个推理步骤进行评分的过程奖励模型、抵御黑客攻击的集成和不确定性估计、人工智能生成的偏好标签(RLAIF)以及产生批评和理由而不是纯粹数字的生成奖励模型。
现实世界的实施
通过在 PPO 培训期间对候选人的回答进行评分,为 ChatGPT 和 Claude 等助理提供 RLHF 动力
Best-of-N 采样,模型生成许多答案,奖励模型为用户选择最佳答案
数学和编码“验证者”或过程奖励模型,对中间推理步骤进行评分以提高问题解决能力
对合成训练数据进行排名和过滤,仅保留高分代以进行进一步微调
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Reward Modeling?
奖励模型是一种经过训练的神经网络,可以预测人工智能的反应有多好,充当人类判断的自动替代品。正是评分引擎使大规模的人类反馈强化学习成为可能。
对于给定的提示响应对,奖励模型的主要输出是什么?
奖励模型将提示和响应映射到代表预测质量或人类偏好的一个标量数字。
哪种人类数据最常用于训练奖励模型?
贴标签者通常会比较对同一提示的两个响应并选择更好的一个; Bradley-Terry 模型将这些转化为标量奖励。
标准奖励模型损失优化了什么?
Bradley-Terry 损失 -log(sigmoid(r_chosen - r_rejected)) 仅关心相对顺序,因此绝对比例是任意的。
什么是“奖励黑客”?
当模型发现不完美的奖励模型评价很高但人类却不会的捷径(例如过长或奉承)时,奖励黑客就会发生。
奖励模型在架构上是如何从语言模型派生出来的?
奖励模型通常会重用 LM 主干,但将最后一层交换为输出单个标量奖励的层。