基础知识指南

准确率和召回率

精确度和召回率是评估分类器的两个互补指标,尤其是当类别不平衡时。

阅读时间:2分钟最后更新

概述

它们共同揭示了纯粹准确率所隐藏的部分——模型的积极预测正确频率,以及实际捕捉到多少真实的正面因素。

深入探讨

当模型将项目标记为积极时,有两个问题很重要。精确度询问:在我们标记的所有内容中,有多少是真正积极的?它等于真阳性除以所有预测阳性,从而惩罚误报。回忆(敏感性)问:在所有真正的积极因素中,我们发现了多少?它等于真实阳性数除以所有实际阳性数,并对未命中进行惩罚。这些通常是权衡的:降低决策阈值可以捕捉到更多的积极信息(更高的召回率),但标记更多的垃圾信息(更低的精确度),反之亦然。优先考虑哪个取决于成本——垃圾邮件过滤器有利于精确性(不要丢弃真正的邮件),而癌症筛查有利于召回(不要错过肿瘤)。 F1 分数(它们的调和平均值)将两者平衡在一个数字中。

技术洞察

这两个指标都来自混淆矩阵的真阳性 (TP)、假阳性 (FP) 和假阴性 (FN):精度 = TP / (TP + FP),召回率 = TP / (TP + FN)。值得注意的是,两者都没有使用真正的负数,这就是为什么当负数远远多于正数时它们仍能提供信息。扫过分类阈值可绘制出精确率-召回率曲线;它下面的区域(平均精度)总结了性能,并且在高度不平衡的数据上优于 ROC-AUC。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

精确度和召回率的未来

随着人工智能进入高风险领域——医疗诊断、内容审核、欺诈——团队越来越多地报告精确度和召回率(及其曲线),而不仅仅是准确度,并调整阈值以匹配现实世界的成本和公平性约束。每组精确度/召回率审核正在成为检测不同人群的不同错误率的标准。期望有更丰富的成本敏感指标、校准概率和工具,让利益相关者能够交互式地选择操作点,而不是接受默认的 0.5 阈值。

现实世界的实施

垃圾邮件过滤器会进行高精度调整,因此合法电子邮件几乎不会被错误地发送到垃圾邮件文件夹。

医学筛查测试优先考虑高召回率,以避免漏掉实际患有该疾病的患者,从而接受更多的误报进行随访。

搜索和推荐系统报告 precision@k(前 k 个结果中有多少是相关的)来衡量排名质量。

欺诈检测通过 F1 分数平衡精确度和召回率,因为误报和遗漏欺诈的成本都很高。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录精确度和召回率在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Precision and Recall quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Tempus AI 精准医疗

常见问题

什么是精准与召回?

精确度和召回率是评估分类器的两个互补指标,尤其是当类别不平衡时。它们共同揭示了简单的准确性所隐藏的内容——模型的积极预测正确的频率,以及它实际捕获了多少真正的积极因素。

Precision and Recall的下一步是什么?

随着人工智能进入高风险领域——医疗诊断、内容审核、欺诈——团队越来越多地报告精确度和召回率(及其曲线),而不仅仅是准确度,并调整阈值以匹配现实世界的成本和公平性约束。每组精确度/召回率审核正在成为检测不同人群的不同错误率的标准。期望有更丰富的成本敏感指标、校准概率和工具,让利益相关者能够交互式地选择操作点,而不是接受默认的 0.5 阈值。

精度回答哪个问题?

Precision = TP / (TP + FP) 衡量模型正面预测的正确性——正面标志的可信度。

对于高度不平衡的数据集,为什么精度和召回率优于普通精度?

因为这两个指标都不使用真正的负例,所以它们不会像准确性那样被大量、易于预测的负类夸大。