译自英文

CutMix是一种数据增强技术,它从一张训练图像中裁剪出补丁并粘贴到另一张图像上,根据补丁面积按比例混合标签。它在计算机视觉任务中提升了模型的鲁棒性和定位能力。

CutMix是一种用于图像分类任务中训练神经网络的数据增强技术。它将图像块的剪切粘贴与mixup引入的标签混合策略相结合。在每次训练迭代中,从一张训练图像中剪切出一个矩形块,并粘贴到第二张图像上,同时将训练标签调整为两个原始标签的加权组合,权重与粘贴块的面积成正比。这种方法鼓励模型关注完整对象,而不是依赖虚假的相关性或局部特征,并且已被证明可以提高分类准确率、对损坏的鲁棒性以及定位性能。

该方法由Sangdoo Yun、Dongyoon Han、Seong Joon Oh、Sanghyuk Chun、Junsuk Choe和Youngjoon Yoo在2019年的一篇论文中提出,他们隶属于Clova AI和NAVER Corporation。该论文题为“CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features”,发表于2019年IEEE/CVF国际计算机视觉大会(ICCV)。自提出以来,CutMix已成为许多最先进视觉模型训练流程中的标准组件,通常与其他增强技术结合使用。

机制

CutMix操作的工作原理如下。给定两个训练样本\(x_A\)和\(x_B\),其独热标签分别为\(y_A\)和\(y_B\),算法首先采样一个二元掩码\(M\),该掩码指示从每张图像中取哪些像素。掩码通过均匀随机选择一个边界框坐标\((r_x, r_y, r_w, r_h)\)生成,框面积比\(\lambda\)从Beta分布中采样,通常参数为\(\alpha = 1\)。新的训练样本通过从图像A中取框外区域、从图像B中取框内区域形成。组合样本的标签计算为\(\tilde{y} = \lambda y_A + (1 - \lambda) y_B\),其中\(\lambda\)是从图像A保留的像素比例。

此过程在训练期间实时应用,意味着每个小批量都会随机增强。掩码为批次中的每个样本独立生成,从而产生多样化的混合图像。剪切位置和大小是均匀随机的,这确保模型看到各种部分遮挡和组合。

与其他增强方法的关系

CutMix建立在早期增强策略的基础上。最直接的先导是mixup,由Hongyi Zhang、Moustapha Cisse、Yann N. Dauphin和David Lopez-Paz于2018年提出,它通过取像素值和标签的凸组合来混合整张图像。Mixup鼓励训练样本之间的线性行为,但可能产生不自然、难以被人类解释的图像。相比之下,CutMix在每个区域内保持图像的自然外观,使增强样本在语义上更连贯。

另一种相关技术是Cutout,由Terrance DeVries和Graham W. Taylor于2017年提出,它随机遮罩图像的矩形区域,将其设置为零。Cutout在像素级别充当一种dropout形式,迫使模型依赖不太突出的特征。CutMix可以被视为一种泛化,用另一张图像的块替换零填充区域,通过混合标签提供额外的监督信号。

CutMix的作者通过实验证明,在多个基准数据集(包括CIFAR-10、CIFAR-100和ImageNet)上,它优于mixup和Cutout。他们还表明,CutMix提高了模型定位对象的能力,如通过指向游戏指标所测量的,因为模型必须关注完整对象才能正确分类混合图像。

实现细节

在实践中,CutMix实现为一个简单的变换,可以添加到任何图像分类训练循环中。对于批次中的每对图像,算法:

  1. 从Beta分布中采样以获得混合比例\(\lambda\)。
  2. 根据\(\lambda\)计算边界框坐标。
  3. 通过将图像B中的块复制到图像A中来创建组合图像。
  4. 将混合标签计算为加权和。

计算开销很小,因为操作仅涉及数组切片和赋值。这使得CutMix易于集成到现有框架中,如PyTorch或TensorFlow。存在许多开源实现,并且该技术通常与其他增强方法(如随机裁剪、翻转和颜色抖动)结合使用。

一个实际考虑是,Beta分布参数\(\alpha\)控制增强的强度。当\(\alpha = 1\)时,分布是均匀的,意味着所有混合比例都同样可能。较小的\(\alpha\)值(例如0.2)产生更极端的混合,其中一张图像占主导,而较大的值产生更平衡的混合。原始论文发现\(\alpha = 1\)在各种数据集上效果良好,但一些后续工作已针对特定任务调整此参数。

应用与扩展

CutMix已应用于图像分类之外。它已用于目标检测、语义分割,甚至用于训练视觉任务的Transformer。混合块的思想已扩展到其他模态,如音频和文本,尽管针对这些数据的离散性质进行了调整。

已提出几种变体。例如,Puzzle Mix于2020年引入,使用更复杂的优化来找到保留对象边界并避免切割显著部分的混合掩码。另一种变体FMix使用傅里叶域掩码创建不规则混合模式。Co-Mixup于2021年提出,将思想扩展到多张图像,并鼓励混合样本之间的多样性。

数据增强的背景下,CutMix通常与其他技术(如Dropout批归一化)结合使用。它已被证明在有限数据上训练大型模型时特别有效,因为它提供了一种减少过拟合的正则化形式。

对模型鲁棒性的影响

CutMix的关键优势之一是提高了对输入损坏和对抗性扰动的鲁棒性。通过训练包含来自其他类别的块的图像,模型学会依赖更广泛的特征集。这减少了过度拟合背景线索或纹理模式(这些在现实场景中可能不存在)的倾向。

研究表明,与使用标准增强或仅使用mixup训练的模型相比,使用CutMix训练的模型在ImageNet的损坏版本(如ImageNet-C)上实现了更高的准确率。该技术还改善了校准,意味着模型的预测概率与实际准确率更一致。

此外,CutMix已被证明可以提高模型在细粒度分类任务上的性能,在这些任务中,类别之间的细微差异很重要。混合图像迫使模型关注判别性部分,而不是依赖全局统计。

行业采用

CutMix已在学术研究和工业界被广泛采用。它包含在流行的深度学习库和框架中,如图像模型的timm库和NVIDIA DALI数据加载库。ImageNet挑战赛和其他比赛中的许多最先进模型已将CutMix用作训练方案的一部分。

Google DeepMindOpenAIAnthropic这样的公司已将CutMix纳入其计算机视觉流程,尽管具体细节通常是专有的。该技术也用于医学成像,其中数据稀缺且增强至关重要。例如,CutMix已应用于胸部X射线分类和病理图像分析,显示出改进的泛化能力。

局限性与考虑

尽管有效,CutMix也有一些局限性。随机剪切粘贴有时会产生不真实的图像,尤其是当块放置在语义不一致的位置时。例如,将汽车的块粘贴到鸟的图片上,如果块覆盖了鸟的关键部分,可能会混淆模型。然而,混合标签通过提供软目标来缓解这一点。

另一个考虑是,CutMix假设输入是像素网格,这不能直接适用于其他数据类型,如图或点云。已为这些模态提出了扩展,但它们需要更复杂的掩码策略。

最后,Beta分布参数的选择会影响性能。虽然\(\alpha = 1\)是一个好的默认值,但某些任务可能受益于调整。原始论文提供了指导,但这仍然是一个经验选择。

结论

CutMix是一种简单而强大的数据增强技术,已成为现代计算机视觉中的主要工具。通过结合mixup和Cutout的优势,它提供了一种正则化模型并提高其鲁棒性和定位能力的方法。其易于实现和在基准测试中的一致收益使其成为许多从业者的默认选择。随着研究的继续,CutMix的变体和扩展可能仍然相关,尤其是在数据有限或条件具有挑战性的领域。

参考文献

  • Yun, S., Han, D., Oh, S. J., Chun, S., Choe, J., & Yoo, Y. (2019). CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features. ICCV.
  • Zhang, H., Cisse, M., Dauphin, Y. N., & Lopez-Paz, D. (2018). mixup: Beyond Empirical Risk Minimization. ICLR.
  • DeVries, T., & Taylor, G. W. (2017). Improved Regularization of Convolutional Neural Networks with Cutout. arXiv.
  • Kim, J.-H., Choo, W., & Song, H. O. (2020). Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup. ICML.
  • Harris, E., Marcu, A., Painter, M., Niranjan, M., Prügel-Bennett, A., & Hare, J. (2020). FMix: Enhancing Mixed Sample Data Augmentation. arXiv.

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:data-augmentation·computer-vision·deep-learning·regularization
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史