ImageNet-Sketch 是一个于 2019 年引入的基准数据集,用于测试图像分类模型在不同视觉领域中的泛化能力。它包含 50,000 张灰度素描图像,每个原始 ImageNet 数据集中的 1,000 个类别各有 50 张图像。这些素描通过谷歌图片搜索收集,搜索词如“sketch of [class name]”,并经过人工筛选以确保描绘的是预期物体。与自然照片不同,这些图像是抽象的线条画,通常细节极少,使其成为对基于标准照片数据集训练的模型进行领域偏移测试的挑战性任务。
该数据集由加州大学伯克利分校的研究人员创建,包括 Haohan Wang、Songwei Ge、Zachary Lipton 和 Eric Xing。它随一篇题为“Learning Robust Global Representations by Penalizing Local Predictive Power”的论文一同发布,该论文在 2019 年神经信息处理系统会议(NeurIPS)上展示。主要动机是提供一个简单而有效的探针,用于评估模型对分布偏移的鲁棒性,特别是从真实世界图像到抽象人类素描的偏移。ImageNet-Sketch 自此成为 Machine learning 和 Deep learning 领域中的标准评估集,通常与 ImageNet-C 和 ImageNet-R 等其他鲁棒性基准一起使用。
构建与特征
构建过程涉及对每个 1,000 个 ImageNet 类别使用模式“sketch of [class]”查询谷歌图片搜索。返回的图像随后被筛选,以移除非素描图像(如照片或图表),并确保每个类别至少有 50 张有效素描。最终数据集每个类别恰好包含 50 张图像,总计 50,000 张。所有图像被调整到一致的分辨率,通常为 224x224 像素,以匹配 Neural network 分类器的标准输入尺寸。
ImageNet-Sketch 的一个关键特征是其依赖人类绘制的素描,这些素描本质上比自然图像更抽象且更不逼真。这些素描通常省略颜色、纹理和细粒度细节,迫使模型依赖全局形状和结构线索。这使得该数据集特别适用于研究模型是否学习了鲁棒、可泛化的特征,还是过度拟合了自然图像中的表面统计特征。
在鲁棒性评估中的作用
ImageNet-Sketch 被广泛用于衡量图像分类器在领域偏移下的鲁棒性。在 ImageNet 上训练的模型在 ImageNet-Sketch 上评估时,通常表现出显著的准确率下降,通常从自然图像上的约 70-80% 的 top-1 准确率降至素描上的 20-30%。这一性能差距凸显了许多 Deep learning 模型在面对分布外输入时的脆弱性。
该数据集经常被纳入鲁棒性排行榜和研究。例如,它是 ImageNet-C 和 ImageNet-P 损坏基准的核心组成部分,尽管它代表的是自然的、人类创造的领域偏移而非合成损坏,因此有所不同。研究人员使用 ImageNet-Sketch 评估各种鲁棒性技术的有效性,如 Data Augmentation 策略、对抗训练和 Residual Network (ResNet) 变体等架构更改。它也被用于探测模型的内部表示,揭示许多模型严重依赖纹理和局部模式而非全局形状,而素描会破坏这些模式。
与其他基准的关系
ImageNet-Sketch 补充了其他领域偏移数据集,如 ImageNet-R(包含绘画和卡通等艺术渲染)和 ImageNet-A(包含自然发生的对抗性示例)。虽然 ImageNet-R 包含多种艺术风格的混合,但 ImageNet-Sketch 专门关注线条画,提供了更清晰的基于形状的识别测试。该数据集还与 Sketchy 数据集和 TU-Berlin 素描数据集相关,但在规模和对 ImageNet 类别的直接对齐方面具有独特性。
在更广泛的 Artificial intelligence 研究背景下,ImageNet-Sketch 在突出当前模型的局限性并推动对鲁棒和可泛化学习的兴趣方面发挥了重要作用。它经常被引用在领域泛化、自监督学习和模型可解释性的论文中。截至 2025 年,它仍然是计算机视觉中的标准评估工具,许多最先进的模型报告其在此基准上的性能。
局限性与批评
ImageNet-Sketch 的一个局限性是素描是从网络搜索中收集的,这可能在风格或内容上引入偏差。例如,某些类别的素描风格可能比其他类别更多样,筛选过程可能无意中包含非纯素描的图像。此外,该数据集是静态的,因此不捕捉随时间演变的素描风格。尽管存在这些问题,其简单性和易用性使其成为研究人员的流行选择。
另一个批评是 ImageNet-Sketch 上的性能下降可能无法完全反映现实世界的领域偏移,因为素描是一种极端抽象。然而,这种极端性正是使数据集对压力测试模型有价值的原因。它迫使研究人员开发超越记忆像素模式的方法,转而学习更抽象、可迁移的表示。
在研究与工业中的使用
在学术研究中,ImageNet-Sketch 经常用于基准测试新架构和训练方法。例如,关于视觉变换器和卷积网络的研究经常在此数据集上报告结果以展示鲁棒性。它也被用于基础模型的开发,其中在多样化数据上的预训练预期能提高在此类分布外集合上的性能。在工业中,从事图像识别系统的公司,如自动驾驶或医学成像领域,可能使用 ImageNet-Sketch 作为模型泛化的合理性检查,尽管在研究中更常见。
该数据集可公开下载,其使用受原始 ImageNet 条款约束,允许非商业研究用途。它已被数千篇论文引用,使其成为该领域最有影响力的鲁棒性基准之一。截至 2025 年,它仍然是一个相关且广泛使用的资源,尤其是在社区专注于构建在多样化和不可预测环境中可靠的模型时。
未来方向
展望未来,研究人员正在探索将 ImageNet-Sketch 扩展到其他领域的方法,如 3D 素描或动画绘图,并创建具有更细粒度类别的更具挑战性版本。也有兴趣使用该数据集训练本质上更鲁棒的模型,而不仅仅是评估它们。例如,一些工作探索将素描数据纳入训练集以改善形状偏差,这可能导致在其他领域偏移上更好的泛化。该数据集仍然是实现真正鲁棒 Artificial intelligence 系统的持续努力中的基石。