ImageNet大规模视觉识别挑战赛(ILSVRC)

译自英文

ImageNet大规模视觉识别挑战赛(ILSVRC)是一项年度竞赛(2010-2017年),软件程序在此竞赛中比拼对图像中物体进行分类和检测的能力,推动了深度学习和计算机视觉的重大进展。

ImageNet大规模视觉识别挑战赛(ILSVRC)是一项年度软件竞赛,于2010年至2017年作为ImageNet项目的一部分举办。它要求算法在一组经过精心挑选的1,000个不重叠对象类别中正确分类和检测对象及场景。该挑战赛被广泛认为催化了计算机视觉领域的深度学习革命,尤其是在2012年,当时一个卷积神经网络在准确率上取得了显著提升。

该竞赛源于ImageNet项目,这是一个为视觉对象识别研究设计的大型视觉数据库。ImageNet由AI研究员李飞飞发起,包含超过1,400万张手工标注的图像,涵盖超过20,000个类别,其中至少一百万张图像还提供了边界框标注。ILSVRC使用了这些图像和类别的一个子集,为评估和比较计算机视觉算法提供了标准化基准。

历史

李飞飞于2006年开始构思ImageNet,旨在扩展用于训练AI算法的数据,当时大多数研究侧重于模型和算法。2007年,她遇到了普林斯顿大学教授Christiane Fellbaum,后者是WordNet的创建者之一,这促使ImageNet基于WordNet的大约22,000个名词构建。李飞飞还受到1987年一项估计的启发,该估计认为普通人能识别约30,000种不同类型的对象。

作为普林斯顿大学的助理教授,李飞飞组建了一个团队,并使用Amazon Mechanical Turk进行图像分类。标注工作从2008年7月持续到2010年4月,涉及来自167个国家的49,000名工人,他们筛选并标注了超过1.6亿张候选图像。每张1,400万张图像都被标注了三次。原计划要求每个类别有10,000张图像,涵盖40,000个类别,但这被证明不切实际;人类最多每秒能分类2张图像,估计需要19人年的劳动。

该数据库首次以海报形式在2009年佛罗里达州举行的计算机视觉与模式识别会议(CVPR)上展示,标题为“ImageNet:大规模分层数据集预览”。2009年,Alex Berg建议增加对象定位任务,这导致了与PASCAL视觉对象类别竞赛的合作。第一届ILSVRC于2010年举办,包含1,000个类别和对象定位,而PASCAL VOC仅有20个类别和19,737张图像。

对深度学习的重要性

2012年9月30日,一个名为AlexNet的卷积神经网络(CNN)在ImageNet 2012挑战赛中实现了15.3%的前五错误率,比第二名低了超过10.8个百分点。这一成功得益于在训练过程中使用图形处理单元(GPU),这是深度学习革命的关键要素。据《经济学人》报道,“突然间,人们开始关注,不仅在AI社区内部,而且在整个科技行业。”

2015年,AlexNet被微软的超过100层超深CNN超越,后者以3.57%的测试集错误率赢得了ImageNet 2015竞赛。Andrej Karpathy在2014年估计,通过集中努力,他可以达到5.1%的错误率,而他实验室中大约10人用较少努力达到了约12-13%的错误率。据估计,人类在最大努力下可以达到2.4%的错误率。

该挑战赛的影响超越了计算机视觉,推动了神经网络架构、训练技术和硬件加速方面的创新。它还影响了机器学习框架的发展以及更广泛的人工智能领域。

数据集

ImageNet众包其标注过程。图像级标注指示图像中是否存在某个对象类别,而对象级标注则提供对象可见部分的边界框。ImageNet使用WordNet模式的一个变体来对对象进行分类,并增加了120个犬种类别用于细粒度分类。

2012年,ImageNet是Mechanical Turk最大的学术用户,平均每位工人每分钟识别50张图像。完整ImageNet的原始计划将包含大约5,000万个干净、多样且全分辨率的图像,分布在约50,000个同义词集上,但这并未实现。

截至2010年4月30日,汇总统计如下:

  • 非空同义词集总数:21,841
  • 图像总数:14,197,122
  • 带有边界框标注的图像数量:1,034,908
  • 带有SIFT特征的同义词集数量:1,000
  • 带有SIFT特征的图像数量:120万

类别

ImageNet的类别是从WordNet概念中筛选出来的。每个概念(可能包含多个同义词,例如“kitty”和“young cat”)被称为“同义词集”或“synset”。WordNet 3.0包含超过100,000个同义词集,其中大部分是名词(超过80,000个)。ImageNet将这些筛选为21,841个可数名词且可视觉化的同义词集。

WordNet 3.0中的每个同义词集都有一个“WordNet ID”(wnid),由词性和偏移量拼接而成。每个wnid以“n”开头,因为ImageNet只包含名词。例如,同义词集“dog, domestic dog, Canis familiaris”的wnid是“n02084071”。这些类别分为9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。

图像格式

图像是从在线图像搜索引擎(Google、Picsearch、MSN、Yahoo、Flickr等)使用多种语言的同义词抓取的。例如,对于德国牧羊犬,他们使用了诸如“German police dog”、“Alsatian”、“ovejero alemán”、“pastore tedesco”和“德国牧羊犬”等术语。

ImageNet包含RGB格式且分辨率各异的图像。例如,在ImageNet 2012的“鱼”类别中,分辨率从4288 x 2848到75 x 56不等。在机器学习中,这些图像通常被预处理为标准恒定分辨率,并在神经网络进一步处理前进行白化。例如,在PyTorch中,ImageNet图像通过将像素值除以255归一化到0和1之间,然后减去[0.485, 0.456, 0.406],再除以[0.229, 0.224, 0.225],这些是ImageNet的均值和标准差。

标签和标注

每张图像都标注了恰好一个wnid。ImageNet-1K的密集SIFT特征(原始SIFT描述符、量化码字和坐标)可供下载,专为视觉词袋设计。对象的边界框可用于约3,000个流行的同义词集,每个同义词集平均有150张图像。此外,一些图像具有属性标注,尽管挑战赛主要侧重于分类和定位任务。

ILSVRC于2017年结束,但其遗产以ImageNet数据集的形式持续存在,该数据集仍然是评估计算机视觉模型的标准基准。该竞赛对大规模、真实世界数据和严格评估的重视推动了该领域的快速进步,影响了后续在生成式AI和机器学习其他领域的发展。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·deep-learning·competition·dataset
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史