译自英文

AlexNet是由亚历克斯·克里热夫斯基、伊利亚·苏茨克弗和杰弗里·辛顿于2012年在多伦多大学开发的深度卷积神经网络,它以15.3%的top-5错误率赢得了ImageNet大规模视觉识别挑战赛,显著推动了深度学习在计算机视觉领域的发展。

AlexNet是一种用于图像分类的卷积神经网络架构,由Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton于2012年在多伦多大学开发。它将图像分类为1,000个不同的对象类别,并被广泛认为是深度卷积网络在视觉识别中的首次大规模展示。该模型包含6000万个参数和65万个神经元,其深度对其高性能至关重要,而这得益于训练期间使用图形处理单元(GPU)。

这三位研究人员组成了SuperVision团队,并于2012年9月30日将AlexNet提交至ImageNet大规模视觉识别挑战赛(ILSVRC)。该网络实现了15.3%的top-5错误率,以超过亚军10.8%的优势赢得比赛。这一结果成为深度学习的转折点,影响了计算机视觉和人工智能领域的大量后续工作。

架构

AlexNet包含八层:前五层是卷积层,其中一些后接最大池化层,最后三层是全连接层。除最后一层外,网络被分成两份副本,每份运行在一个GPU上,因为它无法容纳在单个Nvidia GTX 580的3GB显存中。该结构可以写为(CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax,其中CONV是带有ReLU激活的卷积层,RN是局部响应归一化,MP是最大池化,FC是带有ReLU的全连接层,Linear是无激活的全连接层,DO是dropout。

值得注意的是,卷积层3、4和5在没有池化或归一化的情况下相连。AlexNet使用了非饱和的ReLU激活函数,其训练效果优于tanh和sigmoid。这一选择是其训练效率的关键因素。

训练

ImageNet训练集包含120万张图像。该模型使用两块Nvidia GTX 580 GPU(各3GB)训练了90个周期,耗时五到六天,这些GPU在float32下的理论性能为1.581 TFLOPS,发布时售价为500美元。每次前向传播需要约1.43 GFLOPs,因此在理想条件下,两块GPU合计理论上每秒可执行超过2,200次前向传播。

数据集图像以JPEG格式存储,占用27GB磁盘空间。训练期间,神经网络在每块GPU上使用2GB RAM,并使用约5GB系统RAM。GPU负责训练,而CPU负责从磁盘加载图像并执行数据增强

AlexNet使用动量梯度下降进行训练,批大小为128个样本,动量为0.9,权重衰减为0.0005。学习率初始为10−2,每当验证误差似乎停止下降时,就手动将其降低10倍,共降低三次,最终降至10−5。两种形式的数据增强在CPU上即时计算,使其“计算上免费”:首先,每张图像被缩放,使其较短边为256像素,然后裁剪中央256×256块并进行归一化;其次,随机提取224×224块(及其水平翻转),将训练集大小扩大2048倍。此外,RGB值沿像素值的主方向随机偏移。

选择224×224分辨率是因为256 - 16 - 16 = 224,这意味着在256×256图像的每侧框出16像素后,得到224×224图像。AlexNet使用了局部响应归一化和dropout正则化,drop概率为0.5。所有权重初始化为均值为0、标准差为0.01的高斯分布,卷积层2、4、5以及所有全连接层的偏置初始化为常数1,以避免ReLU死亡问题。

在测试时,图像被缩放,使其较短边为256,裁剪中央256×256块,然后计算五个224×224块(四角和中心)及其水平翻转,共得到10个块。网络在所有10个块上的预测概率被平均,以产生最终预测。

ImageNet竞赛

用于2012年ImageNet竞赛的版本是七个AlexNet的集成。五个标准架构的AlexNet在ILSVRC-2012训练集上训练。还训练了两个变体AlexNet,每个在最后一个池化层之上增加了一个额外的卷积层,首先在完整的ImageNet Fall 2011版本(22K类别中的1500万张图像)上训练,然后在ILSVRC-2012训练集上进行微调。最终系统平均了所有七个网络的预测概率。

历史

先前工作

1980年,Kunihiko Fukushima提出了一种早期CNN,称为neocognitron,通过无监督学习训练。LeNet-5由Yann LeCun等人于1989年开发,使用带有反向传播的监督学习,其架构在小型规模上与AlexNet基本相同。最大池化于1990年用于语音处理,并于1992年首次用于Cresceptron中的图像处理。

在2000年代,随着GPU硬件的改进,研究人员将GPU用于通用计算,包括神经网络训练。2006年,K. Chellapilla等人在GPU上训练了一个CNN,其速度比等效的CPU实现快4倍。2009年,Raina等人在Nvidia GeForce GTX 280上训练了一个具有1亿参数的深度信念网络,速度比CPU快达70倍。2011年,Dan Cireșan等人在IDSIA开发的深度CNN比等效CPU实现快60倍,并且在2011年5月15日至2012年9月10日期间,他们的CNN赢得了四场图像竞赛,并在多个数据库上取得了最先进的结果。根据AlexNet论文,Cireșan的早期网络与AlexNet“有些相似”,两者均使用CUDA编写以在GPU上运行。

计算机视觉

在1990年至2010年期间,神经网络并不优于其他机器学习方法,如核回归和支持向量机。AlexNet在2012年的成功展示了深度学习在计算机视觉中的力量,导致CNN的广泛采用以及后续架构的发展,如残差网络。它还激发了基于GPU的计算在机器学习中的兴趣,并促进了深度学习作为AI主导方法的兴起。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·computer-vision·neural-network·image-classification
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史