译自英文

CIFAR-100-C是一个由CIFAR-100图像损坏版本组成的基准数据集,用于评估机器学习模型对常见图像损坏的鲁棒性。

CIFAR-100-C是一个基准数据集,旨在评估机器学习模型对常见图像损坏的鲁棒性。它由CIFAR-100测试集的损坏版本组成,通过应用15种类型的失真,每种失真具有五个严重级别而生成。该数据集在鲁棒性研究中被广泛使用,用于衡量模型对意外输入扰动的泛化能力,补充标准准确率指标。

原始CIFAR-100数据集包含60,000张32x32彩色图像,分为100个类别,其中50,000张训练图像和10,000张测试图像。CIFAR-100-C取10,000张测试图像,对每种损坏类型在每个严重级别下应用,生成75,000张损坏图像(15种损坏×5个严重级别×10,000张图像)。这些损坏模拟了真实世界的失真,如噪声、模糊、天气效应和数字伪影。

损坏类型

15种损坏类型分为四类:噪声(高斯、散粒、脉冲)、模糊(散焦、霜冻、玻璃、运动、缩放)、天气(雪、霜、雾、亮度)和数字(对比度、弹性、像素化、JPEG)。每种损坏通过算法应用,严重级别从1(轻微)到5(严重)。例如,高斯噪声添加随机像素值,而运动模糊模拟相机移动。该数据集使用标准化代码库生成,确保跨研究的可复现性。

在鲁棒性评估中的使用

CIFAR-100-C常用于衡量神经网络和其他机器学习模型的鲁棒性。研究人员报告所有损坏和严重级别的平均错误率,通常称为平均损坏误差(mCE)。使用数据增强技术(如随机裁剪或颜色抖动)训练的模型,在CIFAR-100-C上的表现通常优于未使用这些技术训练的模型。该基准已成为鲁棒性社区的标准工具,与CIFAR-10-C和ImageNet-C并列。

与其他基准的关系

CIFAR-100-C是Hendrycks和Dietterich于2019年引入的损坏基准家族的一部分,该家族还包括CIFAR-10-C和ImageNet-C。这些数据集共享相同的损坏类型和严重级别,允许跨数据集比较。该基准通常与对抗鲁棒性评估结合使用,尽管它侧重于自然损坏而非恶意扰动。它也被用于研究批量归一化和其他架构选择对鲁棒性的影响。

局限性与扩展

虽然CIFAR-100-C被广泛使用,但它存在局限性。这些损坏是合成的,可能无法完全捕捉真实世界的分布偏移。一些研究人员提出了扩展,如CIFAR-100-P,它包含用于视频类序列的时间相关损坏。其他人使用CIFAR-100-C来评估大型语言模型在视觉任务中的鲁棒性,尽管此类应用较少见。该数据集仍然是基准测试鲁棒性的宝贵资源,尤其适用于小规模模型和快速实验。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·robustness·computer-vision·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史