技术指南

Mixup 和 CutMix 增强

Mixup 和 CutMix 是数据增强方法,通过混合两个图像及其标签来创建新的训练示例。

阅读时间:2分钟最后更新

概述

Mixup linearly interpolates whole images and labels, while CutMix pastes a rectangular patch from one image onto another and mixes labels by patch area — both reduce overfitting and improve robustness.

深入探讨

Mixup(Zhang et al., 2017)形成一个新样本 x̃ = λ·x_a + (1−λ)·x_b,标签 ỹ 与相同的 λ 混合,其中 λ 是从 Beta 分布中提取的。这鼓励模型在示例之间表现出线性,从而平滑决策边界并改进校准。 CutMix (Yun et al., 2019) 相反,从图像 B 中剪切一个矩形区域并将其粘贴到图像 A 上;标签权重由每个图像贡献的像素比例设置。由于 CutMix 保持局部连贯的图像区域(而不是幽灵般的混合),因此它保留了有用的空间结构,同时仍然迫使模型关注多个对象和部分。这两种技术都充当强大的正则化器,提高了 ImageNet 规模基准的准确性,并显着提高了对损坏和对抗性输入的鲁棒性。

技术洞察

两种方法都会修改损失目标,而不仅仅是输入。标签变成了一个软的、混合的目标,因此交叉熵损失是两个类别的 λ 加权组合——实际上是与像素混合比相关的标签平滑的一种形式。在 CutMix 中,λ 等于未改变像素的分数,通过剪切框面积除以总图像面积计算得出,这使标签比例与每个图像的可见部分保持一致。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

Mixup 和 CutMix 增强的未来

基于混合的增强现在是强大的图像分类方法的标准,并支撑了视觉变换器的现代训练管道,这通常需要大量的正则化。关于显着性感知变体(例如,对信息区域进行剪切)、变压器的标记级混合以及音频、文本和 3D 数据的扩展的研究仍在继续。随着架构对数据的需求越来越大,预计混合策略仍将是提高准确性、校准和稳健性的低成本杠杆。

现实世界的实施

使用 CutMix 训练 ImageNet 分类器以提高 top-1 准确度并改善对象的定位。

应用 Mixup 来改进模型校准,使预测的置信度更好地匹配真实的准确性。

结合 Mixup 和 CutMix 对视觉变换器(例如 DeiT)进行大量正则化,以在有限的数据上进行训练。

提高安全关键视觉系统中图像损坏和分布外输入的鲁棒性。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixup and CutMix Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

测试时间增加

常见问题

What is Mixup and CutMix Augmentation?

Mixup 和 CutMix 是数据增强方法,通过混合两个图像及其标签来创建新的训练示例。 Mixup 对整个图像和标签进行线性插值,而 CutMix 将一个图像中的矩形块粘贴到另一张图像上,并按块区域混合标签 - 既减少了过度拟合,又提高了鲁棒性。

Mixup 如何创建新的训练示例?

混合形式 x̃ = λx_a + (1−λ)x_b 并将标签与从 Beta 分布中提取的相同 λ 混合。

CutMix 和 Mixup 的核心区别是什么?

CutMix 将一个矩形区域从一个图像复制到另一个图像中,保持局部连贯的内容,而不是将两个图像重影在一起。

在 CutMix 中,如何确定标签的混合权重 (lambda)?

CutMix 中的标签比例是根据粘贴框相对于整个图像的面积来设置的,使标签与可见像素保持一致。

除了输入图像之外,Mixup 和 CutMix 还修改什么?

这两种方法也混合标签,产生软目标,其作用类似于依赖于数据的标签平滑形式。

哪种分布通常用于对混合系数 lambda 进行采样?

Mixup 和 CutMix 通常从 Beta 分布中提取 λ,该分布控制两个示例混合的强度。