混淆矩阵
混淆矩阵是一个简单的表,它将分类器的预测分为每个类别的正确和错误计数。
概述
It is the raw scoreboard from which nearly every other classification metric is calculated.
深入探讨
混淆矩阵是将预测标签与实际标签进行比较的网格。对于二元分类,它有四个单元格:真阳性(正确预测为阳性)、真阴性(正确预测为阴性)、假阳性(阴性被错误标记为阳性,“I 型错误”)和假阴性(漏掉的阳性,“II 型错误”)。从这四个数字中,您可以得出准确度 ((TP+TN)/总计)、精确度 (TP/(TP+FP))、召回率或灵敏度 (TP/(TP+FN))、特异性 (TN/(TN+FP)) 和 F1 分数(精确度和召回率的调和平均值)。对于两个以上类别的问题,矩阵变为 N×N,其中对角线保存正确的预测,非对角线单元准确地揭示哪些类别与其他类别混淆。
技术洞察
该矩阵的强大之处在于它保留了单个精度数字隐藏的错误结构。两个具有相同 90% 准确率的模型可能具有截然不同的假阴性率,当错过癌症诊断的代价比误报的代价更大时,这一点就非常重要。按照惯例,行通常代表真实的类别,列代表预测的类别(尽管有些库会翻转这一点),因此在计算精度与单元格的召回率之前,请务必检查轴标签。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
混淆矩阵的未来
混淆矩阵仍将是基础性的,但工具正在使它们变得更加丰富:交互式、标准化热图、大型标签集的每类细分,以及将每种错误类型乘以其现实世界惩罚的成本加权矩阵。在公平审计中,从业者现在计算每个人口亚组的单独混淆矩阵,以揭示不平等的错误率。期望继续集成到模型仪表板中,单击单元格会显示实际错误分类的示例以供检查。
现实世界的实施
通过观察图像分类器经常将非对角线单元中的哈士奇与狼混淆来诊断图像分类器失败的地方
通过检查假阴性来审核医疗筛查工具——患有模型宣称健康的疾病的患者
比较两个具有相同准确度但错误阻止的真实电子邮件数量不同的电子邮件垃圾邮件过滤器(误报)
评估多类手写数字识别器,发现 4 和 9 最常被误认为彼此
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录混淆矩阵在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Confusion Matrices quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Confusion Matrices?
混淆矩阵是一个简单的表,它将分类器的预测分为每个类别的正确和错误计数。它是计算几乎所有其他分类指标的原始记分板。
在二元混淆矩阵中,什么是假阴性?
假阴性是模型通过将其标记为阴性而错过的实际阳性 - 例如,一名生病的患者宣布健康。
哪个指标衡量模型正确识别的实际阳性的比例?
召回率(也称为灵敏度或真阳性率)是 TP / (TP + FN) — 模型捕获的真实阳性的比例。
在 5 类问题的混淆矩阵中,对角线单元代表什么?
在 N×N 矩阵中,对角线表示预测类别与真实类别匹配的情况,即正确的预测。
为什么在没有混淆矩阵的情况下,仅凭准确性就会产生误导?
具有相同精度的两个模型的误差分布可能截然不同;混淆矩阵揭示了错误是否主要是误报或漏报。
F1 分数是哪两个指标的调和平均值?
F1 使用调和平均值将精确度和召回率合并为一个数字,这会惩罚两者之间的巨大不平衡。