ROC 曲线和 AUC
ROC 曲线绘制了分类器在每个可能的决策阈值上区分两个类别的效果,而 AUC 将整条曲线压缩为一个数字。
概述
Together they tell you ranking quality independent of where you draw the cutoff.
深入探讨
当您将分类阈值从 1 向下滑动到 0 时,接收者操作特征 (ROC) 曲线会绘制真阳性率(y 轴上的灵敏度)与假阳性率(x 轴上的 1 减去特异性)的关系。每个阈值给出一个分;每个阈值给出一个分。连接它们就可以画出曲线。将所有积极因素排名高于所有消极因素的模型位于左上角。曲线下面积 (AUC) 测量该线下方的总面积,范围从 0.5(随机猜测,对角线)到 1.0(完美)。一个方便的解释:AUC 等于模型对随机选择的正值得分高于随机选择的负值得分的概率。该术语来自二战时期雷达操作员区分信号和噪声的过程。
技术洞察
AUC 与阈值无关,因为它集成了所有截止值的性能,因此它不受您设置决策边界的位置的影响。它在数学上相当于 Mann-Whitney U 统计量和 Wilcoxon 秩和检验,这意味着它仅取决于预测分数的排名顺序,而不取决于它们的绝对值。这使得它在单调分数转换下保持稳定,但对校准也不敏感:排名良好但校准不佳的模型仍然可以获得较高的 AUC。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
ROC 曲线和 AUC 的未来
ROC-AUC 仍然是默认的报告指标,但从业者越来越多地将其与严重不平衡数据的精确召回曲线配对,其中 ROC 可能看起来看似乐观。预计会更广泛地采用部分 AUC(重点关注对操作而言重要的低误报区域)、成本敏感型和决策曲线分析以及针对表面公平性差距的每个子组 AUC 报告。随着模型提供真实决策,校准指标和 AUC 将越来越多地并排报告,而不是单独报告 AUC。
现实世界的实施
通过 AUC 比较银行的两种欺诈检测模型,以选择最能将欺诈交易排在合法交易之上的模型
评估疾病的诊断测试(例如癌症筛查分类器),放射科医生需要在发现更多病例和误报之间进行权衡
使用 ROC 曲线调整垃圾邮件过滤器的阈值,以将误报(合法邮件标记为垃圾邮件)保持在非常低的水平
对信用违约评分模型进行基准测试,其中 AUC 总结了如何区分还款借款人和违约借款人
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录 ROC 曲线和 AUC 在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ROC Curves and AUC quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is ROC Curves and AUC?
ROC 曲线绘制了分类器在每个可能的决策阈值上区分两个类别的效果,而 AUC 将整条曲线压缩为一个数字。它们一起告诉您质量排名,而与您划分界限的位置无关。
ROC 曲线相互绘制哪两个量?
ROC 曲线绘制了 y 轴上的真阳性率(灵敏度)与 x 轴上的假阳性率(1 - 特异性)跨阈值的关系。
什么 AUC 值对应于表现不比随机猜测更好的分类器?
随机分类器追踪对角线,给出的 AUC 为 0.5。 AUC 为 1.0 是完美的,0.0 意味着它使每个排名完全倒退。
为什么 AUC 被描述为“阈值无关”?
AUC 总结了整个 ROC 曲线,该曲线是通过扫描每个阈值生成的,因此它不依赖于任何单个选择的截止值。
对于严重不平衡的数据集,通常建议使用哪条曲线与 ROC 一起使用或代替 ROC,因为 ROC 可能看起来过于乐观?
对于罕见的阳性问题,大量的真阴性使假阳性率保持在较低水平,从而夸大了 ROC。精确率-召回率曲线专注于正类别,更真实地揭示性能。