ImageNet大规模视觉识别挑战赛(ILSVRC)2012年是年度软件竞赛的第三届,参赛程序需正确分类和检测ImageNet数据库中的物体与场景。2012年的挑战赛被广泛视为人工智能历史上的转折点,因为获胜参赛作品,,一个名为AlexNet的神经网络,,在测试集上实现了15.3%的top-5错误率,比亚军低了超过10.8个百分点。这一显著进步展示了深度学习和机器学习技术的强大力量,引发了持续塑造该领域的研究与投资浪潮。
ImageNet项目本身由AI研究员李飞飞于2006年发起,目标是扩大可用于训练AI算法的数据量。李飞飞于2007年与普林斯顿大学教授克里斯蒂安·费尔鲍姆(WordNet的创建者之一)会面,随后以WordNet中约22,000个名词为起点构建了ImageNet。该数据库通过亚马逊Mechanical Turk的众包标注方式构建,标注工作于2008年7月开始,2010年4月结束。这项工作涉及来自167个国家的49,000名工人,筛选并标注了超过1.6亿张候选图像,最终形成了涵盖超过20,000个类别的超过1,400万张人工标注图像。
历史与发展
ImageNet的想法源于李飞飞观察到当时大多数AI研究侧重于模型和算法而非数据。她受到1987年一项估计的启发,该估计认为普通人能识别约30,000种不同物体。2007年,李飞飞与克里斯蒂安·费尔鲍姆会面讨论该项目,会议促成了从WordNet名词同义词集构建ImageNet的决定。李飞飞在普林斯顿大学(她当时任助理教授)组建了一个研究团队,并使用亚马逊Mechanical Turk对图像进行分类。
原计划要求每个类别10,000张图像,共40,000个类别,总计4亿张图像,每张图像需验证三次。然而,人类每秒最多只能分类2张图像,按此速度估计需要19人年的不间断劳动。团队于2009年在佛罗里达举行的计算机视觉与模式识别会议(CVPR)上首次以海报形式展示了该数据库,标题为“ImageNet:大规模层级数据集预览”。
2009年,亚历克斯·伯格建议添加物体定位任务。李飞飞与PASCAL视觉物体类别竞赛接洽寻求合作,最终促成了2010年ImageNet大规模视觉识别挑战赛的启动。该挑战赛使用经过筛选的1,000个非重叠类别列表,而PASCAL VOC在2010年仅有20个类别和19,737张图像。
对深度学习的重要性
2012年9月30日,卷积神经网络(CNN)AlexNet在ImageNet 2012挑战赛中实现了15.3%的top-5错误率,比亚军低了超过10.8个百分点。卷积神经网络的使用因训练期间采用图形处理单元(GPU)而成为可能,这是深度学习革命的关键要素。据《经济学人》报道,“突然间人们开始关注,不仅在AI社区内部,而且在整个科技行业。”
AlexNet的胜利常被视为深度学习热潮的触发点。它证明了神经网络能在复杂视觉任务上取得最先进的结果,导致深度学习技术在各领域迅速被采用,包括生成式AI和大型语言模型。2015年,AlexNet被微软的超过100层超深CNN超越,后者以3.57%的测试集错误率赢得了ImageNet 2015竞赛。
安德烈·卡帕西在2014年估计,通过集中努力,他可以达到5.1%的错误率,而他实验室中约10人用较少努力达到了约12-13%的错误率。据估计,人类在最大努力下可达到2.4%的错误率。
数据集构成
ImageNet众包其标注过程。图像级标注指示图像中是否存在某物体类别,例如“此图像中有老虎”或“此图像中没有老虎”。物体级标注提供所指示物体可见部分的边界框。ImageNet使用WordNet广义模式的变体来对物体进行分类,并增加了120个犬种类别以展示细粒度分类。
2012年,ImageNet是Mechanical Turk最大的学术用户,平均每位工人每分钟识别50张图像。2010年4月30日给出的汇总统计显示,共有21,841个非空同义词集、14,197,122张图像、1,034,908张带边界框标注的图像,以及120万张带SIFT特征的图像。
ImageNet的类别从WordNet概念中筛选而来。每个概念称为一个“synset”(同义词集),WordNet 3.0中有超过100,000个同义词集,其中大多数是名词(80,000多个)。ImageNet将这些筛选为21,841个可数名词且可视觉化的同义词集。每个同义词集有一个WordNet ID(wnid),以“n”开头,因为ImageNet仅包含名词。类别分为9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。
图像格式与预处理
图像使用多种语言的同义词从在线图像搜索引擎(Google、Picsearch、MSN、Yahoo、Flickr)抓取。ImageNet包含RGB格式且分辨率各异的图像。例如,在ImageNet 2012中,“鱼”类别的分辨率从4288 x 2848到75 x 56不等。在机器学习中,这些图像通常被预处理为标准恒定分辨率,并在神经网络进一步处理前进行白化。
例如,在PyTorch中,ImageNet图像默认通过除以像素值归一化到0到1之间,然后减去[0.485, 0.456, 0.406],再除以[0.229, 0.224, 0.225]。这些是ImageNet的均值和标准差,因此这会对输入数据进行白化。
标签与标注
每张图像精确标注一个wnid。ImageNet-1K的密集SIFT特征(原始SIFT描述符、量化码字以及每个描述符/码字的坐标)可供下载,设计用于视觉词袋。约3,000个热门同义词集的物体边界框可用,每个同义词集平均有150张图像。部分图像还带有属性标注,但可用来源中未指定其完整细节。