译自英文

ImageNet大规模视觉识别挑战赛(ILSVRC)2010年是首届年度竞赛,软件程序在此竞赛中竞争对ImageNet数据库中的对象进行分类和检测,使用1,000个不重叠的类别和对象定位。

ImageNet大规模视觉识别挑战赛(ILSVRC)2010年是ImageNet项目主办的年度软件竞赛的首届赛事,ImageNet是一个为视觉物体识别研究设计的大型视觉数据库。该挑战要求参赛程序在从一千个非重叠类别中筛选出的精简列表中正确分类和检测物体与场景,这相比之前的基准测试(如PASCAL视觉物体类别(VOC)竞赛,其在2010年仅使用20个类别和19,737张图像)有了显著扩展。2010年的挑战赛通过提供标准化的大规模评估平台,标志着计算机视觉领域的转折点,这一平台后来催化了深度学习革命。

起源与发展

ImageNet项目由AI研究员李飞飞于2006年构思,当时大多数AI研究侧重于模型和算法,而非数据。李飞飞旨在扩展和改善用于训练AI算法的数据。2007年,她会见了普林斯顿大学教授Christiane Fellbaum(WordNet的创建者之一),这促成了从WordNet约22,000个名词出发构建ImageNet的想法。李飞飞还受到1987年一项估计的启发,该估计认为普通人能识别约30,000种不同的物体。

作为普林斯顿大学的助理教授,李飞飞组建了一个研究团队,并使用Amazon Mechanical Turk进行图像分类。标注工作始于2008年7月,结束于2010年4月,涉及来自167个国家的49,000名工人,他们筛选并标注了超过1.6亿张候选图像。原计划要求每个类别10,000张图像,涵盖40,000个类别,总计4亿张图像,但由于实际限制而缩减规模。该数据库首次以海报形式在2009年佛罗里达州举行的计算机视觉与模式识别会议(CVPR)上展示,标题为“ImageNet:大规模分层数据集预览”。

2009年,Alex Berg建议添加物体定位作为任务,李飞飞联系了PASCAL VOC竞赛寻求合作。这促成了ILSVRC于2010年启动,包含1,000个类别和物体定位,相比PASCAL VOC的20个类别有了大幅扩展。

数据集构成

ImageNet采用众包方式处理其标注过程。图像级标注指示物体类别的存在与否,而物体级标注提供物体可见部分的边界框。数据集使用WordNet模式的变体,并增加了120个犬种类别用于细粒度分类。截至2010年4月30日,数据集包含21,841个非空同义词集(synset)、14,197,122张图像、1,034,908张带有边界框标注的图像,以及120万张带有SIFT特征的图像。

类别从WordNet概念中筛选而来,这些概念称为同义词集。每个同义词集都有一个以“n”开头的WordNet ID(wnid),因为ImageNet仅包含名词。类别分为9个层级,从第1级(如“哺乳动物”)到第9级(如“德国牧羊犬”)。图像通过使用多种语言的同义词从Google、Picsearch、MSN、Yahoo和Flickr等在线搜索引擎抓取。图像为RGB格式,分辨率各异;例如,在2012年的“鱼”类别中,分辨率范围从4288 x 2848到75 x 56。在机器学习中,这些图像通常被预处理为标准分辨率,并在输入神经网络前进行白化处理。

对深度学习的重要性

ILSVRC 2010为2012年的重大突破奠定了基础。2012年9月30日,一个名为AlexNet的卷积神经网络(CNN)在ImageNet 2012挑战赛中实现了15.3%的前五错误率,比第二名低了超过10.8个百分点。这一成功得益于训练过程中使用图形处理单元(GPU),这是深度学习革命的关键要素。据《经济学人》报道,“突然间,人们开始关注,不仅在AI社区内部,而且在整个科技行业。”

2015年,AlexNet被微软的超过100层的极深CNN超越,后者以3.57%的错误率赢得了ImageNet 2015竞赛。Andrej Karpathy在2014年估计,通过集中努力,他可以达到5.1%的错误率,而他实验室的约10人用较少努力达到了大约12-13%。据估计,人类在最大努力下可以达到2.4%的错误率。

遗产

尽管ILSVRC 2010本身并未产生深度学习获胜者,但它建立了推动计算机视觉快速进步的基准。该挑战的大规模、标准化评估成为神经网络深度学习技术发展的催化剂,影响了后续在人工智能及相关领域的研究。该数据集和挑战至今仍具影响力,2010年版为后来展示机器学习方法力量的竞赛奠定了基础。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·image-classification·machine-learning·benchmark
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史