概述
这很重要,因为对提示、模型或检索的更改可以改善一种行为,同时破坏另一种行为。如果没有固定的测试集,团队最终只能通过一些精心挑选的示例来判断更改。
深入探讨
从实际使用开始。日志、支持票、搜索查询和用户访谈显示了人们实际询问的内容,包括发明示例所遗漏的混乱措辞。在启动之前,请领域专家编写输入。您可以添加法学硕士生成的综合案例,只要有人对其进行审查并删除不切实际或重复的项目即可。接下来,定义每种情况的正确含义。有些任务只有一个正确答案,例如分类、提取或事实查找。对于这些,存储一个黄金答案,可以精确比较或在光归一化后进行比较。对于开放式任务,请编写具体的、可检查的标准的标题,例如“提及退款截止日期”或“不推荐竞争对手”。像“有帮助”这样的模糊标准会导致评分不一致,无论评分者是个人还是评委模型。然后有目的地覆盖实际输入的范围。按意图、难度、语言和用户类型标记案例,并检查是否代表了重要的群体。添加边缘情况和对抗性输入: - 不明确的问题 - 缺少信息的请求 - 非常长的输入 - 应拒绝的超出范围的请求 - 提示注入尝试 保留由过去的失败组成的回归切片。根据其必须支持的决策调整集合的大小。几十个精心挑选的案例可以及早发现大问题。可靠地检测微小差异需要更多时间。对于 100 个通过/失败案例,通过率接近 80%,在 95% 的置信度下,误差范围大致为正负 8 个百分点。两点的改进与该大小的噪声无法区分。报告每个切片的结果,而不仅仅是总体平均值。一个常见的错误是将数据集视为已完成。产品和用户发生变化,因此请从新日志中刷新。保留一个你永远不会调整的保留部分,这样你的提示就不会过度适合测试。
战略影响
成本与预算
多年来,架构决策决定着性能和运营成本。
更清晰的判决
技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。
质量控制
更好的工程选择可以减少生产中的可靠性事故。
构建 LLM 评估数据集的未来
评估工具已经迅速成熟。开源框架和托管平台现在可以管理数据集、运行评分器并跟踪一段时间内的结果。合成数据生成可能会不断改进,这使得罕见案例的覆盖成本变得更便宜。它无法取代真实的用户输入作为重要事项的锚点。随着应用程序变得更加代理,评估集越来越多地包括根据最终结果和沿途采取的步骤进行评分的多步骤任务。核心规则变化缓慢:明确定义成功,涵盖真实的输入,使用足够的案例来信任数字,并定期从生产中刷新集合。
现实世界的实施
支持团队导出 300 个删除了个人数据的真实票证,为每个票证标记正确的解决方案,并根据它们对每个新的提示版本进行评分。
对于许多措辞正确的会议总结者,团队会编写一个标题:涵盖三个关键决策,不提出未经支持的主张,保持在 150 个字以内。
该团队添加了边缘情况:空输入、西班牙语问题、包含提示注入尝试的文档以及助理应拒绝的超出范围的请求。
当用户在生产中报告错误的答案时,该案例将进入包含正确答案的数据集,因此从那时起修复程序将保持测试状态。
风险与防护栏
优化一项基准测试可以隐藏更广泛的系统弱点。
基础设施和维护成本常常被低估。
随着系统变得更加复杂,安全性和可观察性差距可能会扩大。
实施路线图
在实施之前定义延迟、质量和成本目标。
在实际负载和数据条件下进行基准测试。
仪器监控错误、漂移和用户影响。
在扩展之前准备回滚和事件响应路径。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Building an LLM Eval Dataset quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是构建 LLM 评估数据集?
LLM 评估数据集是一组精心策划的实际输入,每个输入都配有黄金答案、参考事实或评分标准,您可以根据这些数据运行应用程序来衡量质量并捕获回归。这很重要,因为对提示、模型或检索的更改可以改善一种行为,同时破坏另一种行为。如果没有固定的测试集,团队最终只能通过一些精心挑选的示例来判断更改。
该指南推荐什么作为评估案例的最佳起始来源?
真实的用法捕捉了人们实际询问的内容,包括混乱的措辞。综合案例是经过审查的补充,而不是替代品。
什么时候一个标题比单一的黄金答案更合适?
摘要等开放式输出无法完全匹配。具体的、可检查的标准让评分者能够一致地对其进行评判。
以下哪一项是编写良好的评分标准?
一个好的标准是具体的、可检查的。像“有帮助”这样的模糊标准会导致人们和评判模型的评分不一致。
有 100 个通过/失败案例,通过率接近 80%,指南对误差幅度有何规定?
在 95% 的置信度下,此大小的差值约为 8 个点。如果没有更多的案例,版本之间的微小差异是无法信任的。
回归切片的目的是什么?
将每个已修复的故障添加到数据集中意味着以后的更改无法悄悄地重新引入相同的错误。
继续学习
相关指南
为此主题精选的更多指南