ImageNet-Sketch是一个于2019年引入的基准数据集,用于评估机器学习模型的跨域泛化能力。它包含50,000张灰度素描图像,原始ImageNet数据集中1,000个类别各对应50张图像。这些素描收集自Google的QuickDraw项目及其他来源,代表了对物体的风格化、抽象描绘,与自然照片有显著差异。该数据集广泛用于计算机视觉研究,以测试在自然图像上训练的模型识别素描的能力,这一任务要求对域偏移具有鲁棒性。
该数据集由MIT和Google的研究人员创建,首次发表于论文《Learning Robust Representations by Projecting Supervisory Signals》,作者为Haotian Wang、Weichao Qiu等人。其主要动机是提供一个超越标准测试集的挑战性评估集,因为标准测试集通常与训练数据共享相同分布。通过使用与照片视觉上截然不同的素描,ImageNet-Sketch迫使模型依赖高层语义特征,而非低层纹理或颜色线索。
构建与组成
ImageNet-Sketch包含50,000张图像,在全部1,000个ImageNet类别中每类恰好有50张素描。这些素描来源于QuickDraw数据集,该数据集包含数百万张用户绘制的涂鸦,并经过筛选以匹配ImageNet类别标签。每张素描均为黑白线条画,通常简单而抽象,捕捉物体的基本形状。该数据集有意避免颜色和纹理信息,使其成为对基于形状识别的纯粹测试。
构建过程涉及将QuickDraw类别与ImageNet同义词集进行匹配,然后选择被认为具有代表性的素描子集。最终数据集可公开下载,并已成为该领域的标准基准。研究人员常将其与其他数据集(如ImageNet-C或ImageNet-A)结合使用,以评估对各种分布偏移类型的鲁棒性。
在模型评估中的应用
ImageNet-Sketch主要用于评估深度学习模型的跨域泛化能力,特别是卷积神经网络和更新的基于Transformer (architecture)的架构。当模型在ImageNet(自然图像)上训练并在ImageNet-Sketch上测试时,性能下降程度表明模型学习可迁移特征的效果。严重依赖纹理或背景线索的模型往往表现较差,而捕捉形状和结构的模型则表现更好。
例如,ResNet模型和视觉transformer已在该基准上进行了评估。研究表明,视觉transformer在素描识别上通常优于卷积网络,这可能归因于其全局注意力机制。该数据集也用于数据增强研究,其中测试风格迁移或对抗训练等技术以提高对域偏移的鲁棒性。
与其他基准的关系
ImageNet-Sketch是鲁棒性基准家族的一部分,该家族还包括ImageNet-C(损坏)、ImageNet-A(对抗样本)和ImageNet-R(再现)。ImageNet-C对自然图像应用合成损坏,而ImageNet-Sketch则提供完全不同的视觉风格。这使其成为评估模型泛化能力的互补测试。该数据集常用于排行榜和研究论文中,以报告鲁棒性指标以及原始ImageNet验证集上的准确率。
该数据集也被用于研究神经网络中的“纹理偏差”现象,即模型倾向于依赖局部纹理模式而非全局形状。通过呈现缺乏纹理的素描,ImageNet-Sketch暴露了这种偏差,并鼓励开发更具形状感知能力的模型。
局限性与批评
ImageNet-Sketch的一个局限性在于,素描并非在所有类别中均匀分布;某些类别的图像可能多于或少于50张,尽管该数据集设计为平衡的。此外,这些素描相对简单,可能无法捕捉真实世界素描的全部复杂性,这可能限制研究结果的泛化性。一些研究人员还指出,该数据集偏向于易于素描的类别,如动物和常见物体,而更抽象的类别可能代表性不足。
尽管存在这些局限性,ImageNet-Sketch仍是评估跨域性能的宝贵资源。它在计算机视觉文献中被广泛引用,并继续用于鲁棒性、迁移学习和模型可解释性研究。