过拟合和欠拟合
过度拟合是指模型记住了其训练数据,但在新示例上却失败了;欠拟合是指过于简单而无法捕捉真实模式。
概述
找到它们之间的最佳平衡点是机器学习的核心挑战。
深入探讨
每个模型都适合有限的训练集,但目标是在未见过的数据上表现良好。过拟合模型将训练集的噪声和怪癖视为真实信号:它可能在训练数据上得分为 99%,但在测试集上得分却下降到 70%。欠拟合模型是相反的问题,过于僵化而无法捕获底层结构,因此它在训练和测试数据上的表现都很差。训练和测试表现之间的差距是一个明显的迹象。欠拟合在任何地方都显示为高误差(高偏差);过度拟合表现为低训练误差但高测试误差(高方差)。技巧是识别你遇到的问题,因为修复的方向是相反的。
技术洞察
过拟合和欠拟合是偏差-方差权衡的两端。偏差是由于过于简单化的假设而产生的错误;方差是由于对特定训练样本过于敏感而产生的误差。微小的线性模型具有高偏差和低方差(欠拟合);巨大的无约束模型具有低偏差和高方差(过度拟合)。总预期误差大致分解为偏差平方加方差加上不可约噪声。从业者通过将训练集的准确性与保留的验证集进行比较,观察两条曲线的分歧来检测问题。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
过拟合和欠拟合的未来
这些概念仍然是基础概念,但非常大的神经网络使经典图像变得复杂。现代模型可以拥有比数据点多得多的参数,但仍能很好地概括,这是一种令人惊讶的机制,有时被称为“双下降”,其中测试误差在过度拟合峰值后再次下降。研究越来越关注过度参数化模型泛化的原因、优化器中隐式正则化的作用以及更好地自动检测分布偏移。当现实世界的数据偏离训练数据时,预计会有更丰富的诊断来标记生产中的过度拟合。
现实世界的实施
垃圾邮件过滤器,标记包含特定发件人姓名的每封电子邮件,因为该发件人恰好在训练数据中大量发送垃圾邮件,完全错过了新的垃圾邮件发送者(过度拟合)。
仅使用平方英尺并忽略位置、卧室和条件的房价模型,因此它在昂贵的社区中严重缺失(拟合不足)。
医学图像分类器学习检测医院的扫描仪水印而不是疾病,但在其他医院失败(过度拟合虚假特征)。
绘制训练期间的训练损失与验证损失的图,并在验证损失开始上升而训练损失持续下降时停止(及早发现过度拟合)。
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录过度拟合和欠拟合在哪些方面有帮助,以及哪些更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Overfitting and Underfitting quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是过拟合和欠拟合?
过度拟合是指模型记住了其训练数据,但在新示例上却失败了;欠拟合是指过于简单而无法捕捉真实模式。找到它们之间的最佳平衡点是机器学习的核心挑战。
模型在训练数据上得分为 98%,但在测试集上得分仅为 71%。最有可能出现的问题是什么?
训练精度很高但测试精度却低得多的巨大差距是过度拟合的典型特征:模型拟合训练数据中的噪声而不是一般模式。
哪种情况最能描述欠拟合?
欠拟合模型太简单,无法捕获底层模式,因此它在任何地方都表现不佳,包括在其训练数据上。
在偏差-方差权衡中,高方差与哪种结果最相关?
高方差意味着模型会根据其看到的确切训练数据而发生很大变化,从而导致过度拟合。高偏差是相反的、过于简单化的结果。
贷款违约模型仅使用申请人的年龄,忽略收入、债务和信用记录。它在训练和新数据上都表现不佳。你应该做什么?
到处表现不佳都表明拟合不足。解决方法是增加模型容量,通常通过添加信息特征,使其能够代表真实的关系。
为什么保留验证或测试集对于检测过度拟合至关重要?
如果只看训练精度,过拟合是看不见的。对看不见的数据进行评估暴露了记忆和真正的概括之间的差距。