自玩微调
自对弈微调通过让它与自己过去的输出竞争或学习,生成自己的训练信号来改进模型。
概述
It matters because it can push performance beyond the supervised data using little or no extra human labeling.
深入探讨
自对弈在游戏人工智能中有着深厚的根源:AlphaGo Zero 和 AlphaZero 纯粹是通过与自己进行数百万局比赛而达到超人的水平,没有人类的对局记录。同样的精神现在也出现在语言模型微调中。在SPIN(自玩微调)中,当前模型生成对提示的响应,训练推动模型将自己生成的答案与原始人类编写的答案区分开来,将自己视为玩家和对手。经过连续的迭代,“对手”(前一个检查点)变得更强,因此模型必须不断改进,逐渐缩小与目标分布的差距。最大的吸引力在于数据效率:可以压缩固定的监督数据集以获得更多收益,而无需收集新的人类演示或偏好。
技术洞察
SPIN 将微调作为具有 DPO 式损失的两人游戏:模型经过训练,可以为人类参考响应分配比在先前迭代中自己生成的响应更高的可能性。由于之前的检查点提供了负数,因此难度会随着模型的改进而自动缩放。在游戏系统中,自我游戏与搜索(例如 MCTS)和价值网络相结合,在没有外部数据的情况下生成越来越难的对手的无尽课程。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
自玩微调的未来
自我游戏是打破数据墙的主要候选者,因为它制作自己的课程,而不是依赖稀缺的人类标签。预计数学、代码和定理证明等可验证领域的增长,其中自动检查器会对自我生成的尝试进行评分。风险包括奖励黑客和模型因过多的合成输出训练而崩溃,因此未来的系统可能会将自我游戏与接地信号、验证器以及定期的人类或现实世界反馈结合起来。
现实世界的实施
AlphaGo Zero 和 AlphaZero 完全通过自我对弈达到超人的围棋、国际象棋和将棋水平,无需人类对弈
SPIN 通过迭代区分自己的输出和人类参考答案来提高 LLM 的基准分数
数学和编码模型生成解决方案尝试,然后对自动检查器或单元测试验证的模型进行训练
谈判和对话代理通过反复让对话双方互相对抗来改进策略
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录自玩微调在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Play Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Self-Play Fine-Tuning?
自对弈微调通过让它与自己过去的输出竞争或学习,生成自己的训练信号来改进模型。这很重要,因为它可以使用很少或不使用额外的人工标签来将性能提升到超出监督数据的水平。
哪个著名的系统仅通过自我对弈而没有人类对局记录就达到了超人的围棋水平?
AlphaGo Zero 完全从与自己对战的游戏中学习,从随机游戏开始,并超越了之前在人类游戏中训练的版本。
在SPIN中,模型必须击败的“对手”扮演什么角色?
SPIN 将微调视为一种自博游戏,其中先前迭代的自生成输出作为模型学习超越的负数。
自对弈微调的主要数据效率优势是什么?
自我对弈会产生自己的训练信号,因此固定的监督集可以产生进一步的改进,而无需收集新的演示。
在SPIN的训练目标中,模型被推动做什么?
SPIN 使用 DPO 式损失,奖励将人类参考答案(正数)与模型早期自行生成的答案(负数)区分开来。
为什么自对弈微调的难度会随着迭代而自动增加?
由于每次迭代的负面结果都来自更强大的先前模型,因此如果没有手动课程设计,该模型将面临越来越困难的挑战。