概述
这很重要,因为排行榜数字推动了研究主张和购买决策,而受污染的分数夸大了模型在解决从未见过的问题上的表现。
深入探讨
大型语言模型是在网络规模文本上进行训练的,其中包括 GitHub、arXiv 论文、论坛和教程网站。流行的基准在设计上是公开的,因此它们的问题、答案和讨论会在网络上复制并被纳入培训数据中。污染可以是直接的,即出现确切的测试项目,也可以是间接的,通过释义、翻译、解决方案编写或由看过基准的另一个模型生成的合成数据。如果指令数据集是从类似基准的源组装的,它也可以在微调期间进入。一个有用的区别是只看到问题和看到问题及其答案。第二个更具破坏性,因为模型可以回忆答案而不是计算出答案。结果是分数过高,并且不会转移到新问题上。实验室意识并不新鲜。 GPT-3 论文(2020)在其基准和训练数据之间进行了 13-gram 重叠分析,并承认存在错误留下了一些重叠。当训练数据可用时,重叠搜索是最直接的检查。如果不是,研究人员会使用间接方法:在测试项目开始时提示模型,看看它是否逐字完成其余部分;成员推理方法,例如 Min-K% Prob(Shi 和同事,2023),它考察模型预测文本标记的信心程度;将原始项目的分数与重写或新编写的同等项目的分数进行比较;以及基于时间的分割,比较训练截止之前和之后产生的问题。有两种常见的误解。首先,重叠并不总是能大幅提高分数;一些研究发现对某些任务的影响不大。其次,没有找到确切的重叠并不能证明基准是干净的,因为释义或翻译的副本会忽略字符串匹配。缓解措施包括私人保留的测试集、金丝雀字符串、定期刷新的基准(例如 LiveBench 和 LiveCodeBench)、净化过滤器以及发布污染分析和结果。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
基准污染的未来
评估实践正在转向私有或部分私有的测试集、随着时间的推移添加新项目的基准以及控制测试数据的第三方评估者。这与开放性产生了真正的紧张关系,因为公共基准很容易复制和检查。训练数据的更大透明度将使污染检查变得更加容易,但许多模型开发人员不会发布完整的数据详细信息。读者应谨慎对待任何单一静态基准分数,并在得出强有力的结论之前寻找新数据或保留数据的结果。
现实世界的实施
数学基准的问题被重新发布到论坛上并提供有效的解决方案;网络爬行会收集这些页面,随后对其进行训练的模型会重现准确的答案,包括原始措辞中的一个怪癖。
Scale AI 的研究人员编写了 GSM1k,这是在风格和难度上与 GSM8K 相匹配的新小学数学问题,并发现一些模型在新设置上的得分明显较低,这是过度拟合公共基准的迹象。
记录每个问题日期的编码基准显示,模型在训练截止之前解决的问题远多于之后发布的问题,这就是 LiveCodeBench 旨在公开的模式。
BIG-bench 任务包括一个独特的金丝雀字符串,因此数据团队可以从训练语料库中过滤出包含该字符串的任何文档,然后检查模型是否可以重现它。
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录基准污染在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Benchmark Contamination quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是基准污染?
当评估基准中的问题或答案最终出现在模型的训练数据中时,基准污染就会发生,因此高分可以反映记忆而不是真实能力。这很重要,因为排行榜数字推动了研究主张和购买决策,而受污染的分数夸大了模型在解决从未见过的问题上的表现。
什么是基准污染?
污染意味着模型在训练过程中可能见过测试材料,因此其得分可以反映记忆情况。
BIG-bench 任务中包含的金丝雀字符串的用途是什么?
唯一的标识符可以轻松地从语料库中查找和删除基准文本,并探测模型是否记住了它。
GSM1k 研究表明了什么?
风格和难度相匹配的新问题的下降表明过度拟合公共基准,而不是一般的数学技能。
GPT-3 论文运行了哪些重叠分析?
GPT-3 的作者检查了 13-gram 重叠并承认存在一些未删除的重叠的错误。
Min-K% Prob 的核心思想是什么?
该方法对最低 k% 的标记对数概率进行平均;记忆的文本得分异常高,因为其中几乎没有什么让模型感到惊讶的。
继续学习
相关指南
为此主题精选的更多指南