ImageNet数据集创建

译自英文

ImageNet是由李飞飞及其同事创建的大规模视觉数据库,包含超过1400万张手工标注的图像,涵盖超过20000个类别,并通过其年度识别挑战在推动深度学习发展方面发挥了关键作用。

ImageNet是一个大规模视觉数据库,专为视觉物体识别软件研究而设计。它包含超过1400万张手写标注的图像,标明图中描绘的物体,其中至少一百万张图像还提供了边界框。该数据库涵盖超过20,000个类别,每个类别通常由数百张图像组成。自2010年以来,ImageNet项目每年举办一次软件竞赛,即ImageNet大规模视觉识别挑战赛(ILSVRC),软件程序在此竞赛中竞争以正确分类和检测物体及场景。该挑战使用一个精简的、包含一千个不重叠类别的列表。

该项目由AI研究员李飞飞构思,她于2006年开始研究这一想法。当时大多数AI研究专注于模型和算法,李飞飞旨在扩展和改进用于训练AI算法的数据。2007年,她会见了普林斯顿大学教授Christiane Fellbaum,即WordNet的创建者之一,讨论该项目。这促成了ImageNet的构建,其起点是WordNet中约22,000个名词,并利用了其许多特性。李飞飞还受到1987年一项估计的启发,该估计认为普通人能识别大约30,000种不同种类的物体。

历史与构建

作为普林斯顿大学的助理教授,李飞飞组建了一个研究团队来开展ImageNet项目。他们使用Amazon Mechanical Turk协助图像分类。标注工作始于2008年7月,结束于2010年4月。来自167个国家的49,000名工人参与了筛选和标注超过1.6亿张候选图像。预算允许每张1400万张图像被标注三次。

最初计划要求每个类别有10,000张图像,共40,000个类别,总计4亿张图像,每张验证三次。然而,人类每秒最多只能分类两张图像,按此速度估计需要19人年(不休息)的劳动。该团队首次以海报形式在2009年佛罗里达州举行的计算机视觉与模式识别会议(CVPR)上展示了该数据库,标题为“ImageNet:大规模分层数据集预览”。该海报在2009年视觉科学学会会议上再次使用。

2009年,Alex Berg建议添加物体定位作为任务。李飞飞于2009年接触PASCAL视觉物体类别竞赛寻求合作,这导致了随后于2010年启动的ImageNet大规模视觉识别挑战赛。该挑战包含1000个类别和物体定位,而PASCAL VOC在2010年仅有20个类别和19,737张图像。

对深度学习的重要性

2012年9月30日,一个名为AlexNet的卷积神经网络(CNN)在ImageNet 2012挑战赛中实现了15.3%的前五错误率,比亚军低10.8个百分点以上。使用CNN之所以可行,是因为训练期间使用了图形处理单元(GPU),这是深度学习革命的关键要素。据《经济学人》报道,“突然间,人们开始关注,不仅是在AI社区内部,而是整个科技行业。”

2015年,AlexNet被微软的超过100层的深度CNN超越,后者以3.57%的测试集错误率赢得了ImageNet 2015竞赛。Andrej Karpathy在2014年估计,通过集中努力,他可以达到5.1%的错误率,而他实验室的约10人用较少努力达到了约12-13%的错误率。据估计,人类在最大努力下可以达到2.4%的错误率。

数据集结构

ImageNet众包其标注过程。图像级标注指示图像中是否存在某个物体类别,例如“此图像中有老虎”或“此图像中没有老虎”。物体级标注在指示物体的可见部分周围提供边界框。ImageNet使用WordNet广泛模式的一个变体来对物体进行分类,并增加了120个犬种类别以展示细粒度分类。

2012年,ImageNet是Mechanical Turk最大的学术用户,平均每位工人每分钟识别50张图像。完整ImageNet的原始计划将包含约5000万个干净、多样且全分辨率的图像,分布在约50,000个同义词集上,但这一目标未实现。

截至2010年4月30日,汇总统计为:非空同义词集总数:21,841;图像总数:14,197,122;带边界框标注的图像数:1,034,908;带SIFT特征的同义词集数:1,000;带SIFT特征的图像数:120万。

类别

ImageNet的类别是从WordNet概念中筛选出来的。每个概念,由于可能包含多个同义词(例如,“kitty”和“young cat”),被称为“同义词集”或“synset”。WordNet 3.0中有超过100,000个同义词集,其中大多数是名词(80,000多个)。ImageNet数据集将这些筛选为21,841个可数名词且可视觉化的同义词集。

WordNet 3.0中的每个同义词集都有一个“WordNet ID”(wnid),它是词性部分和“偏移量”(一个唯一标识号)的串联。每个wnid以“n”开头,因为ImageNet仅包含名词。例如,同义词集“dog, domestic dog, Canis familiaris”的wnid是“n02084071”。这些类别分为9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。

图像格式

图像是从在线图像搜索引擎(Google、Picsearch、MSN、Yahoo、Flickr等)使用多种语言的同义词抓取的。例如,对于德国牧羊犬:German police dog、Alsatian、ovejero alemán、pastore tedesco、德国牧羊犬。ImageNet包含RGB格式、分辨率各异的图像。例如,在ImageNet 2012的“鱼”类别中,分辨率范围从4288 x 2848到75 x 56。在机器学习中,这些图像通常被预处理为标准恒定分辨率,并在进一步处理前进行白化,以供神经网络使用。

例如,在PyTorch中,ImageNet图像默认通过将像素值除以255归一化到0到1之间,然后减去[0.485, 0.456, 0.406]并除以[0.229, 0.224, 0.225]。这些是ImageNet的均值和标准差,因此这会对输入数据进行白化。

标签与标注

每张图像被标注为恰好一个wnid。ImageNet-1K的密集SIFT特征(原始SIFT描述符、量化码字以及每个描述符/码字的坐标)可供下载,设计用于视觉词袋。约3,000个流行同义词集提供了物体边界框,每个同义词集平均有150张图像。此外,一些图像具有属性标注,但细节有限。

遗产与影响

ImageNet已成为机器学习计算机视觉研究的基准,推动了人工智能的进步。其年度挑战赛促进了卷积神经网络和其他架构的创新,影响了更广泛的深度学习领域。该数据集的规模和结构也为后续的大规模数据项目和数据增强技术的发展提供了参考。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·deep-learning·image-recognition
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史