ImageNet 2012(AlexNet 时刻)

译自英文

2012年ImageNet大规模视觉识别挑战赛由AlexNet以压倒性优势获胜,这是一种深度卷积神经网络,其错误率的显著下降被广泛视为开启现代深度学习时代的标志性事件。

2012年ImageNet大规模视觉识别挑战赛(ILSVRC)是一项基于ImageNet数据集的年度计算机视觉竞赛,由多伦多大学的Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton开发的深度卷积神经网络AlexNet夺冠。这一结果被广泛认为是开启现代深度学习时代的单一事件。

竞赛背景

ILSVRC自2010年起每年举办,要求参赛者将ImageNet约120万张带标签的训练照片分类到1000个物体类别中,并已成为图像识别进展的标准基准。2010年和2011年的参赛作品主要依赖手工设计的特征提取方法,结合经典机器学习分类器,逐年错误率的改进幅度有限,通常只有几个百分点。

AlexNet的结果

Alex Krizhevsky的参赛作品由其团队使用两块消费级GPU训练约一周完成,取得了15.3%的top-5错误率,较第二名参赛作品的26.2%有显著提升,近十个百分点差距令计算机视觉研究界大为震惊,而该领域大多数研究者此前并未采用深度神经网络方法。AlexNet的架构结合了多个卷积层、ReLU激活函数、dropout正则化和数据增强技术,这些技术虽各自已知,但此前从未在此规模上组合并在GPU硬件上成功训练,部分得益于NVIDIA的CUDA平台。

后续影响

AlexNet相对于其他方法的巨大优势在约两年内改变了AI研究的轨迹:计算机视觉研究几乎全面转向神经网络方法,而大规模标注数据集、GPU计算和深度架构的结合成为后续自然语言处理及其他领域进展所遵循的模板。后续ILSVRC获奖者继续使用深度卷积网络并不断增加深度,到2015年该基准的错误率已降至估计的人类水平以下,促使竞赛组织者将分类赛道视为已解决而退役。2012年的结果常与最初的反向传播工作和后来的Transformer论文并列,被视为对深度学习热潮贡献最大的少数技术成果之一,该热潮催生了2020年代的大语言模型,并巩固了Hinton作为该领域核心人物的声誉,远早于他2024年获得诺贝尔奖

分类:history-of-ai·deep-learning·computer-vision
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史