ImageNet挑战赛,正式名称为ImageNet大规模视觉识别挑战赛(ILSVRC),是一项年度软件竞赛,参赛程序需正确分类并检测图像中的物体和场景。该挑战赛于2010年启动,使用从更大的ImageNet数据库中精选出的一千个不重叠类别列表,该数据库包含超过1400万张手工标注图像,涵盖超过20,000个类别。这一挑战赛成为计算机视觉领域的关键基准,并在2012年后催化了深度学习革命。
历史
AI研究者李飞飞于2006年开始构思ImageNet概念,旨在扩展可用于训练AI算法的数据,当时大多数研究侧重于模型。2007年,李飞飞遇到了普林斯顿大学教授Christiane Fellbaum,她是WordNet的创建者之一,并基于WordNet中约22,000个名词构建了ImageNet。她的灵感来自1987年的一项估计,即普通人能识别约30,000种物体。
作为普林斯顿大学的助理教授,李飞飞组建了一个团队,使用Amazon Mechanical Turk进行图像分类。标注工作从2008年7月持续到2010年4月,涉及来自167个国家的49,000名工人,他们筛选并标注了超过1.6亿张候选图像。每张1400万张图像都被标注了三次。原计划为每个类别提供10,000张图像,覆盖40,000个类别,但这一目标未能实现。
该数据库首次以海报形式在2009年佛罗里达州举行的计算机视觉与模式识别会议(CVPR)上展示,标题为“ImageNet:大规模分层数据集预览”。2009年,Alex Berg建议增加物体定位任务,促成了与PASCAL视觉物体类别竞赛的合作。2010年的首届ImageNet挑战赛包含1,000个类别和物体定位,而PASCAL VOC仅有20个类别和19,737张图像。
对深度学习的重要性
2012年9月30日,一个名为AlexNet的卷积神经网络(CNN)在ImageNet 2012挑战赛中实现了15.3%的前五错误率,比第二名低10.8个百分点以上。这一成功得益于在图形处理单元(GPU)上进行训练,这是深度学习革命的关键要素。据《经济学人》报道,“突然间,人们开始关注,不仅在AI社区内部,而且在整个科技行业。”
2015年,AlexNet被微软的超过100层的超深CNN超越,后者以3.57%的测试集错误率赢得了ImageNet 2015竞赛。Andrej Karpathy在2014年估计,通过集中努力,他可以达到5.1%的错误率,而通过最大努力,人类可以达到2.4%。
数据集
ImageNet众包其标注过程。图像级标注指示物体类别的存在或缺失,而物体级标注提供边界框。该数据集使用WordNet模式的变体,并增加了120个犬种类别用于细粒度分类。
截至2010年4月30日,ImageNet拥有21,841个非空同义词集、14,197,122张图像、1,034,908张带边界框标注的图像,以及120万张带SIFT特征的图像。2012年,ImageNet是Mechanical Turk全球最大的学术用户,工人平均每分钟识别50张图像。
类别
类别从WordNet概念中筛选,每个称为“synset”(同义词集)。ImageNet包含21,841个可视觉展示的可数名词同义词集。每个同义词集有一个以“n”开头的WordNet ID(wnid)(例如,“狗”为“n02084071”)。类别分为9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。
图像格式
图像通过使用多种语言的同义词从在线搜索引擎(Google、Picsearch、MSN、Yahoo、Flickr)抓取。它们采用RGB格式,分辨率各异;例如,在ImageNet 2012中,“鱼”类别从4288 x 2848到75 x 56像素不等。在机器学习中,图像通常预处理为标准分辨率并白化。例如,在PyTorch中,图像通过将像素值归一化到[0,1],减去[0.485, 0.456, 0.406],并除以[0.229, 0.224, 0.225]来标准化。
标签和标注
每张图像都标注一个唯一的wnid。密集SIFT特征(原始描述符、量化码字和坐标)可用于ImageNet-1K,专为视觉词袋设计。边界框可用于约3,000个流行同义词集,每个平均150张图像。一些图像还具有属性标注,但细节有限。
遗产
ImageNet挑战赛在推动机器学习和深度学习技术方面发挥了重要作用。它普及了神经网络架构(如残差网络)和训练方法(如批归一化和数据增强)的使用。该竞赛的成功激发了人们对人工智能的兴趣,并影响了后续在生成式AI和大语言模型研究方面的发展,尽管挑战赛本身专注于视觉任务。