## ImageNet ImageNet 是一个大型视觉数据库,旨在用于视觉对象识别软件研究。该数据库包含超过1400万张手绘注释图像,这些图像被组织成超过2万个类别。ImageNet 项目由斯坦福大学的计算机科学家李飞飞于2006年发起,并于2009年在计算机视觉与模式识别会议(CVPR)上首次公开亮相。 ImageNet 数据集在深度学习领域,尤其是卷积神经网络(CNN)的发展中起到了关键

译自英文

ImageNet是由李飞飞及其合作者创建的大规模标注图像数据集,基于该数据集的年度ILSVRC竞赛,其2012年的版本催化了深度学习的热潮。

ImageNet是一个大规模标注图像数据集,按照WordNet名词层级结构组织,并且,由此延伸,它也常被用来指代基于该数据集举办的年度ImageNet大规模视觉识别挑战赛(ILSVRC)。该数据集由李飞飞及其在普林斯顿和斯坦福的同事自2006年起创建,于2009年首次展示,最终扩展到约1400万张图像,涵盖超过20,000个类别,其中用于比赛的ILSVRC子集覆盖了1,000个对象类别。ImageNet被广泛认为提供了使深度学习方法在计算机视觉领域变得实用所需的数据规模,而其2012年的比赛常被引为触发该领域现代复兴的时刻。

历史

李飞飞启动ImageNet项目,是出于一种信念,即视觉识别的进展主要受限于缺乏足够大规模、多样且标注良好的数据集,而非算法本身。团队基于WordNet词汇数据库,着手为每个名词同义词集收集图像,利用网络图像搜索收集候选,并通过Amazon Mechanical Turk的众包方式验证标签。完整数据集于2009年IEEE计算机视觉与模式识别会议上展示,ILSVRC竞赛于次年启动,研究团队在约120万张训练图像的保留子集上,就分类和检测任务展开较量。

2012年的突破

2012年的ILSVRC是数据集最著名的时刻。由亚历克斯·克里热夫斯基、伊利亚·苏茨克维和杰弗里·辛顿提交的一个卷积神经网络,后来被命名为AlexNet,将比赛的前5错误率从约26%降至约15%,这一幅度远超前任何一年的进步。这一成果依赖于在ImageNet规模的标注数据上使用GPU硬件训练深度网络,详情见2012年ILSVRC事件的条目。这次胜利说服了当时偏爱手工特征和其他机器学习方法的计算机视觉社区,即在大规模标注数据上训练的深度神经网络能在很大程度上超越以往方法。

遗产与影响

2012年之后,ILSVRC的获胜者几乎每年都是深度网络,VGG、GoogLeNet和ResNet等架构在2015年前将前5错误率逐步降至5%以下,低于同一任务中通常归因于人类标注者的错误率。ImageNet预训练也成为标准技术:在ImageNet上为分类训练的模型被重新用作其他视觉任务的特征提取器或微调起点,这是迁移学习的早期大规模实例。数据集作为共同基准的角色使得在一致的条件下比较架构成为可能,这种做法后来被用于语言和推理模型的基准所继承。竞赛本身持续到2017年,之后组织者判断错误率已饱和,接近标注本身噪声的实际极限。

批评

ImageNet也因其作为大规模网络抓取训练数据固有问题的例子而受到审视。研究人员发现,完整1400万图像集中的某些非对象类别,尤其是从WordNet继承的“人物”分支,包含冒犯性或不当的标签,促使ImageNet团队在2019年移除或模糊了该分支的大部分内容。这一事件成为讨论算法偏差和负责任地策划互联网规模数据集难度的常用案例,预示了后来关于用于预训练生成模型的文本和图像语料库的类似辩论。

分类:computer-vision·datasets·history-of-ai·deep-learning
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史