ImageNet-A是一个于2019年由Dan Hendrycks、Kevin Zhao及其同事等研究人员引入的数据集,旨在作为评估机器学习模型在自然发生的对抗性示例上鲁棒性的基准。与通过合成扰动制造的对抗性图像不同,ImageNet-A包含的是未经故意修改但被许多标准深度学习模型错误分类的真实照片。与包含1000个对象类别的原始ImageNet相比,ImageNet-A仅包含其中200个类别的图像,并且该数据集的策划特别关注现实中的困难案例。
ImageNet-A背后的动机源于观察到许多模型在标准测试集上取得近乎完美的分数,但在与日常世界典型场景相似的图像上却表现糟糕。ImageNet-A中的图像是物体在不同情境下的自然照片,包括不寻常的角度、雾或新颖的照明,与ImageNet验证集中的干净图像截然不同。关键见解在于,这些图像并非在包含故意的、不可察觉的噪声的意义上具有对抗性,而是暴露了模型在实验室条件与真实世界部署之间的性能差距。
构建与特征
ImageNet-A的创建涉及从网络收集图像,然后仔细过滤以避免与ImageNet训练集或验证集中的图像重叠。策划者选择了人类评估者视觉上可识别但持续混淆知名模型(如ResNet和VGG风格架构)的图像。最终数据集包含超过7500张图像,涵盖原始1000个类别中的200个。为了验证难度,作者报告称,标准预训练的ResNet-50模型在ImageNet-A上的top-1准确率仅为约0.1%,与其在ImageNet验证集上约76%的准确率形成鲜明对比。
策划过程是迭代的:首先从公共来源收集候选图像,然后使用模型预测来识别那些以高置信度被错误分类的图像。随后,人类验证每张图像是否明确属于给定类别并正确标注。这种人在回路中的方法确保了高标签质量,因为模糊或模型正确分类的图像被移除。
与对抗鲁棒性的关系
该数据集位于机器学习鲁棒性与人工智能评估的交汇点。它表明,自然发生的数据中的分布偏移对模型的挑战可能与合成对抗攻击中的微小扰动一样大。术语“自然对抗性示例”用于强调这些图像并非通过优化方法构造,但它们却引发训练好的神经网络出现类似的失败。ImageNet-A的观察结果影响了后续的鲁棒性研究,包括开发诸如ImageNet-C(用于损坏)和ImageNet-R(用于渲染)等基准。
在研究中的应用
ImageNet-A迅速成为评估模型泛化能力及其处理自然分布偏移能力的标准检查点。它已被用于评估各种模型架构,包括残差网络、Transformer和更新的规模化架构。在深度学习社区中,通常会在标准验证集准确率之外报告ImageNet-A上的性能,以此识别那些不仅仅过拟合干净图像的模型。
除了标准模型评估外,该数据集还作为研究错误分类原因的基础。例如,它被用于探究数据增强技术的属性如何影响分布外性能,以及训练采用课程学习策略的模型以缓解此类失败。此外,研究表明,在更大数据集上训练或使用更多自监督方法的模型可能在ImageNet-A上表现出更好的鲁棒性,但由于自然变异性的多样性,仍无法完全弥合差距。
局限性与批评
ImageNet-A存在几个实际问题。该数据集仅限于200个类别,且仅包含早期模型错误分类的类别,这可能造成偏差,使得用其他生成方法训练的分类器难以保持公平。此外,使用模型预测的策划过程可能带来选择偏差,强调2019年时代模型的特定盲点。截至2020年代初,更鲁棒的规模化模型在ImageNet-A上的得分有所提高,但完全解决分布偏移所需的灵活性仍是挑战。批评者还指出,与其他鲁棒性基准相比,该数据集较小,限制了性能测量的统计功效。
遗产与影响
ImageNet-A的引入促进了社区更广泛地认识到需要在标准测试准确率之外评估模型。它已被纳入多个排行榜,并在许多关于模型鲁棒性的更大规模综述中被简要提及。特别是,收集人类完全置信标注但模型失败的天然示例的方法已成为其他数据集(如控制全局旋转的ObjectNet)的蓝图,并聚焦于实践中遇到的世界。该数据集仍然是验证声称具有更好鲁棒性的新机器学习方法的常用工具,并继续作为后续分布外泛化近似方法的试金石。
一个核心要点是,ImageNet-A强调了在基准设置中模型的准确率与其在现实世界中的可靠行为之间观察到的分歧。它引导了关于如何更负责任地在从研究转向行业应用时调度模型的重要学术讨论,这与伯克利人工智能研究和斯坦福人工智能实验室等实验室的研究目标产生共鸣。