基础知识指南

正则化

正则化是一组故意约束模型的技术,以便它可以推广到新数据而不是记住训练集。

阅读时间:2分钟最后更新

概述

It is the main toolkit for fighting overfitting.

深入探讨

如果不加以控制,灵活的模型将自行扭曲以适应训练数据中的每个点,包括噪声。正则化通过添加有利于更简单解决方案的惩罚或约束来进行反击。最常见的形式是根据模型权重的大小向损失函数添加一项。 L2 正则化(权重衰减)平滑地惩罚大权重,将其缩小到零并生成更平滑的模型。 L1 正则化会惩罚权重的绝对值,并且可以将权重的绝对值一直驱至零,从而有效地选择特征子集。除了权重惩罚之外,dropout 在训练期间随机关闭神经元,提前停止在过度拟合之前停止训练,数据增强扩展了有效训练集。每个都牺牲一点训练准确性来换取更好的现实世界性能。

技术洞察

大多数正则化都会重塑优化器最小化的目标。您不是仅仅最小化预测误差,而是最小化误差加上 lambda 乘以权重惩罚,其中 lambda 控制强度。 L2加上权重的平方和,鼓励很多小的权重; L1 添加绝对权重的总和,鼓励精确零的稀疏性。 Dropout 的工作方式有所不同:通过将每一步的激活值随机归零,它可以防止神经元共同适应并近似训练子网络的集合。所有这些都以稍微增加偏差为代价来减少方差。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

正则化的未来

像 L2 和 dropout 这样的显式惩罚仍然是标准的,但注意力正在转向隐式正则化,即随机梯度下降等优化器悄悄地将巨大的模型偏向通用解决方案,即使没有额外的惩罚。标签平滑、混合和更强的数据增强等技术对于训练大型视觉和语言模型越来越重要。期待更多的研究来了解为什么过度参数化网络能够抵抗过度拟合,以及在训练期间自动调整正则化强度而不是依赖手动搜索的自适应方法。

现实世界的实施

将 L2 权重衰减添加到深度图像分类器中,使其能够从数千张训练照片泛化到看不见的照片。

在基因组学模型中使用 L1 正则化可以自动从数千个基因中选择少数能够实际预测结果的基因。

在推荐网络中应用 dropout,使其不会过度依赖任何单个用户信号。

一旦验证损失停止改善,即使训练损失可能继续下降,也要尽早停止训练。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录正则化在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

权重衰减和 L2 正则化

常见问题

What is Regularization?

正则化是一组故意约束模型的技术,以便它可以推广到新数据而不是记住训练集。它是对抗过度拟合的主要工具包。

正规化的首要目标是什么?

正则化有意限制模型,以阻止记忆训练数据,从而提高未见过的示例的性能。

哪种正则化技术最有可能将某些权重精确为零,从而有效地选择特征?

L1 惩罚权重的绝对值,这往往会将不太有用的权重推至恰好为零,从而执行自动特征选择。 L2 平滑地缩小权重,但很少精确到零。

Dropout 如何在训练过程中规范神经网络?

Dropout 在每个训练步骤中随机将一小部分激活归零,防止神经元过度依赖彼此并近似子网络的集合。

在正则化损失“误差+ lambda × 惩罚”中,增加 lambda 有什么作用?

Lambda 控制正则化强度。更大的 lambda 会给惩罚带来更大的影响,更积极地将权重缩小到更简单的模型。

为什么早期停止可以被视为正则化的一种形式?

当验证性能停止改善时停止,可以防止模型继续进入记忆噪声的状态,就像其他正则化器限制复杂性一样。