基础知识指南

双下降现象

双下降是一个令人惊讶的观察结果,即随着模型变大,测试误差首先在“插值阈值”附近变得更糟,但随后又变得更好——这违背了经典教科书的权衡。

阅读时间:2分钟最后更新

概述

It matters because it helps explain why enormous, overparameterized neural networks generalize well instead of overfitting.

深入探讨

经典统计学告诉我们一条 U 形曲线:随着模型复杂性的增加,测试误差下降,触底,然后随着模型过度拟合而上升。双下降法由 Belkin、Hsu、Ma 和 Mandal 在 2019 年推广,并由 OpenAI 进行了大规模研究,表明曲线有第二次下降。测试误差在插值阈值处达到峰值,即模型具有足够参数来准确拟合每个训练点(零训练误差)的点。如果将其推入过度参数化的状态,测试误差会再次下降,通常低于经典的最佳点。同样的效果出现在模型大小、训练时间(“epoch-wise”双下降)和数据集大小上。它重新构建了“更多参数总是意味着过度拟合”这一古老的担忧。

技术洞察

在插值阈值处,本质上存在一种完全适合数据的解决方案,并且它被迫呈锯齿状和高范数,因此泛化能力很差。在过度参数化的情况下,存在无限多个零误差解,并且梯度下降的隐式偏差趋向于最平滑、最低范数的解。对低复杂度插值器的偏好(而不是参数计数本身)是推动第二次下降以降低测试误差的原因。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

双下降现象的未来

研究人员正在使用双重下降来完善缩放法则并选择何时停止训练,因为“训练时间更长,变得更糟,然后更好”具有真正的成本影响。期望有更严格的理论将其与隐式正则化、神经正切核和 grokking 连接起来。实际上,这个教训——更大、更长可以帮助越过危险区域——已经支持了训练更大的基础模型而不是精心设计的模型的决定。

现实世界的实施

解释为什么 1750 亿参数的语言模型尽管容量大得多,但比精心调整的中型语言模型具有更好的泛化能力

选择训练超过验证损失暂时恶化的点,因为历元双下降预测稍后的恢复

诊断视觉模型,当参数数量与训练集大小匹配时,该模型的准确性会下降,然后引导其更深入地过度参数化

在 AutoML 中告知模型大小决策,以便从业者避免脆弱的插值阈值区域

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录双下降现象在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Double Descent Phenomenon quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Double Descent Phenomenon?

双下降是一个令人惊讶的观察结果,即随着模型变大,测试误差首先在“插值阈值”附近变得更糟,但随后又变得更好——这违背了经典教科书的权衡。这很重要,因为它有助于解释为什么巨大的、过度参数化的神经网络能够很好地泛化而不是过度拟合。

测试误差通常在双下降曲线的何处达到峰值?

误差峰值发生在插值阈值处,此时模型具有足够的能力通过基本上一种刚性解决方案将训练误差驱动至零。

当模型严重过度参数化时,测试错误会发生什么情况?

在过度参数化的情况下,测试误差第二次下降,这是赋予双重下降名称的定义特征。

为什么梯度下降在过度参数化的情况下有帮助?

由于有许多可用的零误差解决方案,梯度下降的隐式偏差会转向最平滑、范数最低的解决方案,从而具有更好的泛化能力。

“时代明智”的双重血统是指作为什么函数出现的效应?

沿着训练时间轴可能会发生双重下降:随着训练持续更多的时期,测试误差可能会恶化然后改善。

双血统挑战了哪一个经典观念?

它与教科书 U 形曲线相矛盾,即超过某一点的复杂性总是会因过度拟合而增加测试误差。