ImageNet是一个大规模视觉数据库,专为视觉物体识别软件研究而设计。该项目提供了超过1400万张手绘标注图像,标明图像中的物体,其中至少一百万张图像还包含边界框。它涵盖超过20000个类别,每个类别通常包含数百张图像。第三方图像URL的标注数据库可免费获取,但实际图像并不归ImageNet所有。自2010年以来,该项目每年举办一次软件竞赛,即ImageNet大规模视觉识别挑战赛(ILSVRC),程序使用包含一千个非重叠类别的精简列表来竞争分类和检测物体及场景。
历史
AI研究员李飞飞于2006年开始构思ImageNet的想法。当时大多数AI研究侧重于模型和算法,李飞飞旨在扩展和改进用于训练AI算法的数据。2007年,李飞飞与普林斯顿大学教授Christiane Fellbaum会面,后者是WordNet的创建者之一,讨论该项目。这次会面促使李飞飞从WordNet的大约22000个名词出发构建ImageNet,并采纳了其许多特性。她还受到1987年一项估计的启发,该估计认为普通人能识别大约30000种不同物体。
作为普林斯顿大学的助理教授,李飞飞组建了一个研究团队来开展该项目。他们使用Amazon Mechanical Turk帮助分类图像。标注工作始于2008年7月,结束于2010年4月,涉及来自167个国家的49000名工人,他们筛选并标注了超过1.6亿张候选图像。预算允许每张1400万图像被标注三次。最初计划要求每个类别有10000张图像,共40000个类别,总计4亿张图像,每张验证三次。然而,人类最多每秒能分类2张图像,按此速度估计需要19人年不间断劳动。
该数据库首次以海报形式在2009年佛罗里达州举行的计算机视觉与模式识别会议(CVPR)上展示,题为“ImageNet:大规模分层数据集预览”。2009年,Alex Berg建议添加物体定位任务。李飞飞于2009年与PASCAL视觉物体类别竞赛接洽合作,促成了2010年启动的ImageNet大规模视觉识别挑战赛,包含1000个类别和物体定位,而PASCAL VOC仅有20个类别和19737张图像。
对深度学习的重要性
2012年9月30日,一个名为AlexNet的卷积神经网络(CNN)在ImageNet 2012挑战赛中以15.3%的top-5错误率获胜,比第二名低10.8个百分点以上。训练期间使用图形处理单元(GPU)使卷积神经网络变得可行,这是深度学习革命的关键要素。据《经济学人》报道,“突然间,人们开始关注,不仅在AI社区内部,而且在整个科技行业。”
2015年,AlexNet被微软的超过100层深度CNN超越,后者以3.57%的测试集错误率赢得了ImageNet 2015竞赛。Andrej Karpathy在2014年估计,通过集中努力,他可以达到5.1%的错误率,而他实验室的约10人用较少努力达到了大约12-13%。据估计,人类在最大努力下可以达到2.4%。
数据集
ImageNet众包其标注过程。图像级标注指示图像中是否存在物体类别,例如“此图像中有老虎”或“此图像中没有老虎”。物体级标注提供指示物体可见部分的边界框。ImageNet使用WordNet广义模式的变体来分类物体,并增加了120个犬种类别以展示细粒度分类。
2012年,ImageNet是Mechanical Turk全球最大的学术用户,平均工人每分钟识别50张图像。完整ImageNet的原始计划将包含约5000万个干净、多样且全分辨率的图像,分布在约50000个同义词集上,但这一目标未实现。截至2010年4月30日的汇总统计包括21841个非空同义词集、14197122张总图像、1034908张带边界框标注的图像、1000个带SIFT特征的同义词集,以及120万张带SIFT特征的图像。
类别
ImageNet的类别是从WordNet概念中筛选出来的。每个概念,由于可能包含多个同义词(例如,“kitty”和“young cat”),被称为“同义词集”或“synset”。WordNet 3.0有超过100000个同义词集,其中大多数是名词(超过80000个)。ImageNet将这些筛选为21841个可数名词且可视觉化的同义词集。WordNet 3.0中的每个同义词集都有一个“WordNet ID”(wnid),是词性和偏移量的连接。每个wnid以“n”开头,因为ImageNet仅包含名词;例如,“dog, domestic dog, Canis familiaris”的wnid是“n02084071”。类别分为9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。
图像格式
图像使用多种语言的同义词从在线图像搜索引擎(Google、Picsearch、MSN、Yahoo、Flickr等)抓取,例如“German shepherd”、“German police dog”、“Alsatian”、“ovejero alemán”和“pastore tedesco”。ImageNet由RGB格式、分辨率各异的图像组成;例如,在ImageNet 2012“鱼”类别中,分辨率范围从4288 x 2848到75 x 56。在机器学习中,这些图像通常被预处理为标准的恒定分辨率,并在进一步处理前进行白化,以供神经网络使用。例如,在PyTorch中,ImageNet图像通过将像素值除以归一化到0到1之间,然后减去[0.485, 0.456, 0.406],再除以[0.229, 0.224, 0.225]来标准化,这些是ImageNet的均值和标准差。
标签和标注
每张图像被标注为恰好一个wnid。ImageNet-1K的密集SIFT特征(原始SIFT描述符、量化码字和坐标)可供下载,专为视觉词袋模型设计。边界框可用于约3000个流行的同义词集,每个同义词集平均有150张图像。此外,一些图像具有属性标注,该数据集已被广泛用于机器学习研究,特别是用于训练和评估人工智能模型。
遗产和影响
ImageNet对计算机视觉和人工智能领域产生了深远影响。它提供了一个标准化基准,加速了物体识别和分类的进展。2012年AlexNet的成功引发了深度学习革命,导致深度学习技术在各领域的广泛采用。ImageNet的层次结构和大规模也影响了其他数据集的发展和transformer基础模型的设计,这些模型后来成为生成式AI和大型语言模型的基础。该数据集仍然是训练和评估视觉识别系统的关键资源,其遗产继续塑造AI研究和应用。