ImageNet是一个大规模视觉数据库,专为视觉物体识别软件的研究而设计。该项目包含超过1400万张手工标注的图像,标明图中出现的物体,其中至少一百万张图像还提供了边界框。它涵盖超过20000个类别,每个类别通常包含数百张图像。第三方图像URL及其标注的数据库可免费获取,但实际图像并不归ImageNet所有。自2010年以来,ImageNet每年举办一次竞赛,即ImageNet大规模视觉识别挑战赛(ILSVRC),软件程序在此竞赛中使用一千个不重叠类别的精简列表对物体和场景进行分类和检测。
该项目源于AI研究员李飞飞的构想,她于2006年开始研究这一想法,旨在扩展和改进用于训练AI算法的数据。当时,大多数AI研究侧重于模型和算法,但李飞飞试图解决数据瓶颈问题。2007年,李飞飞会见了普林斯顿大学教授Christiane Fellbaum,她是WordNet的创建者之一,随后她以WordNet中约22000个名词为基础构建了ImageNet,并融入了其许多特性。李飞飞还受到1987年一项估计的启发,该估计认为普通人能识别约30000种不同类型的物体。作为普林斯顿大学的助理教授,李飞飞组建了一个研究团队,并使用Amazon Mechanical Turk辅助图像分类。标注工作于2008年7月开始,2010年4月结束,来自167个国家的49000名工人筛选并标注了超过1.6亿张候选图像,预算足以让每张1400万图像标注三次。
该数据库最初于2009年在佛罗里达举行的计算机视觉与模式识别会议(CVPR)上以海报形式展示,标题为“ImageNet:大规模层级数据集预览”。2009年,Alex Berg建议增加物体定位作为任务,这促成了与PASCAL视觉物体类别竞赛的合作,并于2010年启动了ImageNet大规模视觉识别挑战赛,该挑战赛包含1000个类别和物体定位,远超PASCAL VOC在2010年的20个类别和19737张图像。
数据集构建
ImageNet采用众包方式进行标注。图像级标注指示图像中是否存在某个物体类别,例如“此图像中有老虎”或“此图像中没有老虎”。物体级标注在指示物体的可见部分周围提供边界框。ImageNet使用WordNet广义模式的一种变体来对物体进行分类,并增加了120个犬种类别以进行细粒度分类。2012年,ImageNet是Mechanical Turk全球最大的学术用户,平均每位工人每分钟识别50张图像。完整ImageNet的原始计划是约5000万张干净、多样且全分辨率的图像,分布在约50000个同义词集上,但这一目标并未实现。
截至2010年4月30日的汇总统计:
- 非空同义词集总数:21841
- 图像总数:14197122
- 带边界框标注的图像数:1034908
- 带SIFT特征的同义词集数:1000
- 带SIFT特征的图像数:120万
类别与图像格式
ImageNet的类别是从WordNet概念中筛选出来的。每个可能包含同义词的概念被称为“同义词集”或“synset”。尽管WordNet 3.0拥有超过100000个同义词集,其中大部分是名词(超过80000个),但ImageNet将可数名词的数量聚焦到21841个可视觉化的同义词集。每个同义词集都有一个WordNet ID(wnid),它是词性和偏移量的连接;所有wnid都以“n”开头,因为ImageNet仅包含名词。例如,“狗,家犬,Canis familiaris”的wnid是“n02084071”。类别跨越9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。
图像通过多语言同义词从在线图像搜索中抓取。它们以RGB格式呈现,分辨率各不相同。例如,在ImageNet 2012的“鱼”类别中,分辨率范围从4288 x 2848到75 x 56。在机器学习中,这些图像通常在训练前被预处理为标准恒定分辨率并白化。例如,在PyTorch中,图像通过将像素值除以255归一化到0和1之间,然后减去均值[0.485, 0.456, 0.406]并除以标准差[0.229, 0.224, 0.225]。这些统计数据源自ImageNet。
标签与标注
每张图像都精确标注一个wnid。ImageNet-1K的密集SIFT特征(包括原始SIFT描述符、量化码字和坐标)可供下载,专为词袋方法设计。物体的边界框可用于约3000个同义词集,每个平均有150张图像。一些图像具有属性标注,但细节未完全指定。数据集还包括一些带SIFT特征的120万图像的同义词集。
对深度学习的重要性
ImageNet在深度学习革命中发挥了关键作用。2012年9月30日,一个名为AlexNet的卷积神经网络在ImageNet 2012挑战赛中实现了15.3%的前五错误率,比亚军低10.8个百分点以上。这一成功得益于在训练期间使用图形处理单元(GPU),这成为深度学习革命的关键要素。据《经济学人》报道,“突然间,人们开始关注,不仅在AI社区内部,而且在整个科技行业。”2015年,AlexNet被微软的超过100层的超深CNN超越,后者以3.57%的错误率赢得了ImageNet 2015竞赛。2014年,Andrej Karpathy估计,通过集中努力,他可以达到5.1%的错误率,而他实验室的约10人用较少努力达到了约12-13%。据估计,人类在最大努力下可以达到约2.4%的错误率。
ImageNet的影响远远超出了竞赛本身。大规模、结构化且带标签的数据集的可用性使研究人员能够以前所未有的规模和多样性训练和基准测试模型。这推动了Deep learning创新(如神经网络、残差网络)以及Data Augmentation和Batch Normalization等技术的采用。它还加速了机器学习和人工智能的进展,其基准任务(如分类和定位)已成为评估计算机视觉系统的基础。该数据集通过WordNet的组织方式影响了其他大规模数据集以及PyTorch等框架中的标准工作流程。
ImageNet的公开可用性也产生了更广泛的影响。它被许多研究团队和公司(包括Google DeepMind、OpenAI和Microsoft)用于训练和评估模型。其影响延伸到Transformer (architecture)架构的发展,这些架构此后已成为语言建模的标准。近年来,ImageNet仍然是计算机视觉研究的重要参考,尽管该数据集也因使用第三方图像而引发了关于版权和隐私的讨论。尽管存在这些担忧,ImageNet的规模和结构继续激励着不同领域的类似数据集,如ImageNet,但焦点仍在于原始ImageNet及其在推进视觉识别中的作用。
来源与影响
总之,ImageNet的创建是人工智能历史上的一个里程碑事件。它提供了一个全面且可扩展的数据集,突显了数据驱动方法的重要性。其对深度学习热潮的影响不容低估,因为它促成了算法和硬件上的突破,从而带来了当前生成式AI和大模型的时代。截至2025年,ImageNet仍然是评估新方法和新理论(如涉及transformer、大型语言模型和基础模型的方法)的基准。该项目的草根方法,即通过全球社区众包标注,也为后来的许多数据集和倡议树立了模式。
ImageNet的成功表明,高质量、大规模的数据集不仅有益,而且往往对AI进展至关重要。它推动了分布式计算和云服务(如Amazon Web Services和Google Cloud)的进步,以及来自NVIDIA和AMD等公司的硬件改进**。竞赛本身,即ImageNet大规模视觉识别挑战赛,仍然是衡量计算机视觉进展的机构。尽管AI持续演进,ImageNet的遗产依然存在,从学术研究到自动驾驶车辆、医学成像和多模态系统的实际部署,塑造了该领域从符号AI向神经网络和机器学习的发展轨迹。在发布后的几年里,ImageNet影响了后续数据集(如COCO和Flickr)的设计,这些数据集同样旨在提供大规模、带标注的数据,以推进机器智能的前沿。