ImageNet-1K是ImageNet视觉数据库的一个标准化子集,恰好包含1,000个不重叠的物体类别。它被引入作为ImageNet大规模视觉识别挑战赛(ILSVRC)的分类和定位基准,该挑战赛始于2010年。该子集源自更大的ImageNet数据集,后者包含超过1,400万张人工标注图像,涵盖超过20,000个类别,通过选择一组精简的、可数名词且视觉上可区分的类别而得出。ImageNet-1K成为机器学习和深度学习中的关键参考点,在2010年代作为神经网络架构和训练技术进展的主要试验平台。
该数据集的图像来源于第三方URL,并非ImageNet自身所有。每张图像被标注为恰好一个类别标识符,称为WordNet ID(wnid),对应于WordNet词汇数据库中的一个同义词集。这些类别涵盖广泛的日常物体,从动物和植物到车辆和家居用品,并包括120个细粒度的犬种类别以测试细微辨别能力。ImageNet-1K图像为RGB格式,分辨率各异,通常在输入模型前被预处理为固定大小并进行归一化。
历史与创建
AI研究员李飞飞于2006年构思了ImageNet项目,旨在将AI研究重点从算法转向大规模数据。2007年,她会见了普林斯顿大学教授、WordNet创建者克里斯蒂安·费尔鲍姆,并决定使用WordNet的名词层级作为骨干来构建数据集。该项目于2008年7月开始使用Amazon Mechanical Turk进行标注,来自167个国家的49,000名工人筛选了超过1.6亿张候选图像。标注于2010年4月结束,每张1,400万图像均经过三次验证。
最初计划设想40,000个类别,每个类别有10,000张图像,但实际限制(包括人类分类速度约为每秒2张图像)导致范围缩减。首次公开展示是2009年在佛罗里达举行的计算机视觉与模式识别会议(CVPR)上的海报。2009年,亚历克斯·伯格建议增加物体定位功能,促成了与PASCAL视觉物体类别竞赛的合作,并于2010年推出了包含1,000个类别的ILSVRC。
在深度学习中的作用
ImageNet-1K于2012年9月30日获得广泛关注,当时一个名为AlexNet的卷积神经网络在ImageNet 2012挑战赛中以15.3%的top-5错误率获胜,比亚军高出超过10.8个百分点。这一成功得益于在图形处理单元(GPU)上进行训练,这是深度学习革命的关键要素。正如《经济学人》所指出的,这一结果引起了整个科技行业的关注。
随后几年取得了快速进展。2015年,微软的超过100层超深CNN以3.57%的错误率赢得了ImageNet 2015竞赛。安德烈·卡帕西在2014年估计人类表现约为5.1%(在集中努力下),在最大努力下可能达到2.4%,这表明模型很快接近或超过了该基准上的人类水平分类能力。ImageNet-1K成为残差网络架构、批归一化和数据增强技术等创新的标准评估集。
数据集结构
ImageNet-1K类别从WordNet 3.0中筛选,后者包含超过80,000个名词同义词集。选择过程为完整ImageNet保留了21,841个同义词集,并为ILSVRC选择了1,000类子集。每个同义词集都有一个唯一的wnid,例如“n02084071”对应“狗,家犬,Canis familiaris”。这些类别组织成9个级别的层级结构,从“哺乳动物”等宽泛概念到“德国牧羊犬”等具体品种。
图像通过使用多种语言的同义词从包括Google、Picsearch、MSN、Yahoo和Flickr在内的在线搜索引擎中抓取。例如,德国牧羊犬类别使用了诸如“Alsatian”和“pastore tedesco”等查询。分辨率差异很大,从4288 x 2848到鱼类类别中的75 x 56像素不等。在实践中,图像被调整为恒定分辨率并进行白化处理;例如,PyTorch通过将像素值除以到[0,1]、减去均值[0.485, 0.456, 0.406]并除以标准差[0.229, 0.224, 0.225]来进行归一化。
标注与使用
每张ImageNet-1K图像携带一个类别标签。完整ImageNet还为约3,000个流行同义词集中的约100万张图像提供边界框标注,以支持物体定位任务。为1,000类子集发布了密集SIFT特征,专为视觉词袋方法设计,但随着深度学习的兴起,这些方法变得不那么常见。
截至2010年摘要,ImageNet拥有21,841个非空同义词集、14,197,122张图像和1,034,908张带边界框的图像。该数据集的标注可免费获取,但图像本身并非ImageNet所有。尽管出现了更大规模的数据集和替代基准,ImageNet-1K仍广泛用于人工智能中的预训练和基准测试。
遗产与影响
AlexNet在ImageNet-1K上的成功催化了深度学习热潮,影响了计算机视觉之外的领域,包括自然语言处理和大语言模型的发展。该基准的明确指标和大规模使其成为比较模型架构、训练方法和硬件效率的标准。然而,关于标注噪声和数据集静态性质的担忧引发了批评,一些研究人员提出了更新的基准。尽管如此,ImageNet-1K仍是机器学习研究和教育中的基础资源。