ImageNet数据集创建

译自英文

ImageNet是由李飞飞及其同事创建的大型视觉数据库,于2009年推出,包含超过1400万张手工标注的图像,涵盖20000多个类别,并成为视觉识别领域的基准,推动了深度学习的进步。

ImageNet 是一个大型视觉数据库,专为视觉目标识别软件研究而设计。它包含超过 1400 万张人工标注的图像,涵盖超过 20000 个类别,每个类别通常包含数百张图像。其中至少一百万张图像带有边界框标注。该数据库的标注信息和第三方图像 URL 可免费获取,但实际图像并不归 ImageNet 所有。自 2010 年起,该项目每年举办一次软件竞赛,即 ImageNet 大规模视觉识别挑战赛(ILSVRC),参赛程序需使用一个精简的、包含一千个不重叠类别的列表来对目标和场景进行分类与检测。

该项目源于 AI 研究者李飞飞的构想,她希望扩充可用于训练 AI 算法的数据,而当时大多数研究都聚焦于模型和算法本身。ImageNet 自此成为深度学习革命的基石,推动了计算机视觉领域的突破,并影响了更广泛的人工智能领域。

历史

李飞飞于 2006 年开始构思 ImageNet。2007 年,她会见了普林斯顿大学教授克里斯蒂安·费尔鲍姆,共同讨论这一项目,而这次会面促使李飞飞以 WordNet 中约 22000 个名词为基础来构建 ImageNet,并借鉴了其许多特性。她还受到 1987 年一项研究的启发,该研究估计普通人能识别约 30000 种不同类别的物体。

作为普林斯顿大学的助理教授,李飞飞组建了一个研究团队来推进该项目。他们利用亚马逊土耳其机器人平台协助进行图像分类。标注工作始于 2008 年 7 月,于 2010 年 4 月结束,共有来自 167 个国家的 49000 名工作者参与,对超过 1.6 亿张候选图像进行了筛选和标注。在预算允许的范围内,每张图像都经过了三次标注。

最初的计划是为 40000 个类别各收集 10000 张图像,总计 4 亿张,且每张都经过三次验证。然而,考虑到人类每秒最多只能分类两张图像,按此速度完成全部工作预计需要 19 人年,因此原定计划未能完全实现。

该数据库首次以海报形式亮相于 2009 年在佛罗里达举办的计算机视觉与模式识别会议(CVPR),海报标题为“ImageNet:大规模层级数据集的预览”。该海报随后也在 2009 年的视觉科学学会会议上展出。

2009 年,亚历克斯·伯格建议在挑战赛中增加目标定位任务。李飞飞团队与 PASCAL VOC 竞赛展开合作,最终促成了 2010 年 ImageNet 大规模视觉识别挑战赛的启动。该挑战赛包含 1000 个类别及目标定位任务,而相比之下,2010 年的 PASCAL VOC 仅有 20 个类别和 19737 张图像。

对深度学习的重要意义

2012 年 9 月 30 日,一个名为 AlexNet 的卷积神经网络(CNN)在 2012 年 ImageNet 挑战赛中以 15.3% 的 top-5 错误率夺冠,比第二名低了 10.8 个百分点。这一成绩得益于训练过程中使用图形处理器(GPU),而这正是深度学习革命的关键要素。《经济学人》杂志评论道:“突然间,人们开始关注这一领域,不仅限于 AI 社区,整个科技行业都为之侧目。”

2015 年,微软推出的具有超过 100 层的深度 CNN 超越了 AlexNet,以 3.57% 的错误率赢得了 2015 年 ImageNet 竞赛。安德烈·卡帕西在 2014 年估计,经过集中努力,人类可以将错误率降至 5.1%,而他实验室的约 10 名成员在较少投入的情况下达到了约 12-13% 的错误率。据估计,人类若全力以赴,可将错误率降至 2.4%。

这些成果证明了深度学习神经网络架构的强大威力,加速了机器学习技术在整个科技行业的广泛应用。

数据集

ImageNet 的标注过程采用众包方式。图像级标注用于指示图像中是否存在某类目标,例如“图像中有老虎”或“图像中没有老虎”。目标级标注则提供所指示目标在图像中可见部分的边界框。ImageNet 使用 WordNet 架构的一个变体来对目标进行分类,并额外增加了 120 个犬种类别,以支持细粒度分类任务。

2012 年,ImageNet 是亚马逊土耳其机器人平台上最大的学术用户,平均每位工作者每分钟可标注 50 张图像。

截至 2010 年 4 月 30 日的统计数据如下:

  • 非空 synset 总数:21841
  • 图像总数:14197122
  • 带有边界框标注的图像数:1034908
  • 带有 SIFT 特征的 synset 数:1000
  • 带有 SIFT 特征的图像数:120 万

类别

ImageNet 的类别是从 WordNet 概念中筛选出来的。每个概念由于可能包含多个同义词(例如“kitty”和“young cat”),因此被称为“synset”(同义词集)。WordNet 3.0 中包含超过 100000 个 synset,其中大多数为名词(超过 80000 个)。ImageNet 数据集从中筛选出 21841 个可数名词 synset,这些名词所对应的事物均可通过视觉方式加以展示。

WordNet 3.0 中的每个 synset 都有一个“WordNet ID”(wnid),由词性缩写和一个“偏移量”(唯一标识数字)拼接而成。由于 ImageNet 仅包含名词,因此所有 wnid 均以字母“n”开头。例如,synset“dog, domestic dog, Canis familiaris”的 wnid 为“n02084071”。

ImageNet 的类别分为 9 个层级,从第 1 级(如“mammal”)到第 9 级(如“German shepherd”)。

图像

ImageNet 的图像是通过多种语言的同义词从 Google、Picsearch、MSN、Yahoo 和 Flickr 等在线图像搜索引擎中抓取获得的。例如,对于“German shepherd”这一类别,搜索词包括“German police dog”、“Alsatian”、“ovejero alemán”、“pastore tedesco”以及“德国牧羊犬”。

ImageNet 中的图像为 RGB 格式,分辨率各异。例如,2012 年挑战赛中的“fish”类别图像分辨率从 4288 x 2848 到 75 x 56 不等。在机器学习应用中,这些图像通常会被预处理为统一的标准分辨率,并在输入神经网络之前进行白化处理。例如,在 PyTorch 中,ImageNet 图像会先除以 255 将像素值归一化到 0 到 1 之间,然后减去均值 [0.485, 0.456, 0.406],再除以标准差 [0.229, 0.224, 0.225],从而实现白化。

标注

每张图像都精确对应一个 wnid 标签。对于 ImageNet-1K 数据集,其密集 SIFT 特征(包括原始 SIFT 描述符、量化码本以及每个描述符的坐标)可供下载,这些特征是为词袋视觉模型而设计的。此外,约 3000 个常用 synset 中的图像还提供了目标边界框标注,每个 synset 平均包含约 150 张带有边界框的图像。此外,部分图像还带有属性标注,但此处未详细说明其完整范围。

遗产

ImageNet 的创建标志着 AI 领域向以数据为中心的方法转变,影响了后续众多数据集和基准测试的构建。其年度挑战赛成为衡量计算机视觉进展的标准,其成功也推动了生成式人工智能及其他 AI 应用的蓬勃发展。该数据集至今仍是训练和评估模型的基础资源,其影响力延伸至自动驾驶和医学影像等领域。

尽管取得了巨大成就,ImageNet 也引发了关于偏见和标注质量的讨论,促使 AI 社区对数据集构建和伦理问题进行反思。然而,其在现代 AI 发展中的核心地位无可争议,并且至今仍在研究和工业界被广泛使用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·deep-learning·artificial-intelligence
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史