语言人工智能指南

Perplexity 和语言指标

Perplexity 是衡量语言模型对真实文本的“惊讶”程度的经典分数 - 较低意味着它更自信地预测单词。

阅读时间:2分钟最后更新

概述

It and metrics like BLEU and ROUGE are how researchers actually measure whether a model is getting better.

深入探讨

语言模型为每个下一个单词分配一个概率。 Perplexity 将这些概率转化为一个数字,该数字询问:平均而言,模型在每一步中都会做出多少个同等可能的选择?如果模型完全自信且正确,则困惑度为 1;如果模型完全正确,则困惑度为 1;如果在50,000个单词中统一猜测,则困惑度为50,000。越低越好。它是平均每个单词损失的数学指数,因此它直接跟踪训练。但困惑度只衡量下一个单词的预测,而不衡量输出是否有用、真实或写得好。这就是为什么生成任务添加了 BLEU(用于翻译的 n 元语法重叠)和 ROUGE(用于摘要的重叠)等指标,以及为什么现代评估越来越依赖于人类评分和任务基准的原因。

技术洞察

Perplexity 等于模型分配给保留文本的平均负对数似然指数:exp(-(1/N) * log P(单词 | 前一个单词)) 的总和。它实际上是交叉熵损失的转换版本,只是表示为有效分支因子而不是位或 nat。因为它取决于模型的确切词汇和分词器,所以困惑度值只能在共享相同分词的模型之间进行比较——直接将词级模型与子词模型进行比较是没有意义的。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

Perplexity 和语言指标的未来

Perplexity 仍将是核心训练时诊断,因为它成本低廉且跟踪优化顺利,但该领域在判断真实能力方面已很大程度上超越了它。随着模型饱和,评估正在转向任务基准,例如 MMLU、人类偏好排名以及法学硕士作为法官对有用性和正确性的评分。预计困惑度仍将是工程师在预训练期间观察的仪表板指标,而公众声称模型“更好”的说法依赖于基准套件和面对面的人类评估,而这些评估无法捕捉推理和真实性。

现实世界的实施

在预训练期间跟踪验证困惑,以确认模型仍在学习并检测模型何时开始过度拟合

使用 BLEU 分数将新机器翻译系统与人工参考翻译进行比较

报告 ROUGE-L 重叠,以根据黄金标准摘要对新闻摘要模型进行基准测试

比较同一保留语料库上的两个模型检查点,以确定哪一个更自信地预测文本

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Perplexity and Language Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Perplexity and Language Metrics?

Perplexity 是衡量语言模型对真实文本的“惊讶”程度的经典分数 - 较低意味着它更自信地预测单词。它以及 BLEU 和 ROUGE 等指标是研究人员实际衡量模型是否变得更好的方式。

较低的困惑度分数表明语言模型的什么?

Perplexity 衡量模型对真实文本的惊讶程度;较低的困惑度意味着它为实际的下一个单词分配了更高的概率,因此它的预测更加自信。

Perplexity 在数学上是从哪个训练量导出的?

Perplexity 是平均负对数似然的指数,使其成为模型经过训练以最小化的交叉熵损失的直接变换。

模型在不进行学习的情况下为 10,000 个单词的词汇分配统一的概率。它的困惑是什么?

Perplexity 是同等可能选择的有效数量。超过 10,000 个单词的纯统一猜测会产生 10,000 的困惑度。

为什么两个不同模型的困惑度分数在直接比较时会产生误导?

由于困惑度是按标记计算的,因此单词级模型和子单词模型以不同的方式分割文本,使得它们的原始困惑度值无法直接比较。

哪个指标与通过 n-gram 与参考重叠来评估机器翻译最相关?

BLEU 测量系统翻译和人类参考之间单词 n 元语法的重叠,是翻译评估的长期标准。