AlexNet里程碑论文

译自英文

AlexNet是一个深度卷积神经网络,由Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton于2012年开发,在ImageNet挑战赛中以15.3%的top-5错误率获胜,点燃了深度学习革命。

AlexNet是一种为图像分类而开发的卷积神经网络架构,因其在ImageNet大规模视觉识别挑战赛(ILSVRC)中的表现而声名鹊起。它能将图像分类到1,000个不同的物体类别中,并被广泛认为是深度卷积网络在大规模视觉识别中的首次广泛应用。该模型于2012年由Alex Krizhevsky与Ilya Sutskever及其博士导师Geoffrey Hinton在多伦多大学合作开发,包含6000万个参数和65万个神经元。原始论文的主要结论是,模型的深度对其高性能至关重要,这在计算上代价高昂,但由于训练期间使用了图形处理单元(GPU)而变得可行。

三人组成的团队SuperVision于2012年9月30日提交了AlexNet参加ImageNet大规模视觉识别挑战赛。该网络实现了15.3%的top-5错误率,以超过亚军10.8个百分点的优势赢得了比赛。该架构影响了后续大量在深度学习领域的工作,尤其是在将神经网络应用于计算机视觉方面。

架构

AlexNet包含八层:前五层是卷积层,其中一些后面接有最大池化层,最后三层是全连接层。除最后一层外,网络被分成两个副本,每个副本在一个GPU上运行,因为网络无法容纳在单个Nvidia GTX 580 3GB GPU的显存中。整个结构可以写成(CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax,其中CONV = 卷积层(使用ReLU激活),RN = 局部响应归一化,MP = 最大池化,FC = 全连接层(使用ReLU激活),Linear = 全连接层(无激活),DO = dropout。

值得注意的是,卷积层3、4和5相互连接,中间没有任何池化或归一化。它使用了非饱和的ReLU激活函数,其训练效果优于tanh和sigmoid。这一选择是加快训练速度和提升性能的关键因素。

训练

ImageNet训练集包含120万张图像。该模型使用两块Nvidia GTX 580 GPU(各3GB)训练了90个周期,历时五到六天。这些GPU在float32下的理论性能为1.581 TFLOPS,发布时售价为500美元。AlexNet的每次前向传播大约需要1.43 GFLOPs。基于这些数值,两块GPU在理想条件下理论上每秒能够执行超过2,200次前向传播。

数据集图像以JPEG格式存储,占用27GB磁盘空间。训练期间,神经网络在每块GPU上占用2GB RAM,并在系统RAM中占用约5GB。GPU负责训练,而CPU负责从磁盘加载图像并对图像执行数据增强

AlexNet使用动量梯度下降进行训练,批大小为128个样本,动量为0.9,权重衰减为0.0005。学习率从10−2开始,每当验证误差似乎不再下降时,就手动将其降低10倍。训练期间共降低了三次,最终达到10−5。

它使用了两种形式的数据增强,两者都在CPU上即时计算,因此“计算成本为零”:

  • 首先将ImageNet中的每张图像缩放,使其较短边长度为256。然后裁剪出中央的256×256块并进行归一化(将像素值除以255使其落在0和1之间,然后减去[0.485, 0.456, 0.406],再除以[0.229, 0.224, 0.225]。这些是ImageNet的均值和标准差,因此这会使输入数据白化)。
  • 从256×256的裁剪中提取随机的224×224块(及其水平翻转)。这使训练集的大小增加了2048倍。
  • 沿着图像像素RGB值的三个主方向随机平移每个图像的RGB值。

选择224×224的分辨率是因为256 - 16 - 16 = 224,这意味着给定一个256×256的图像,在其四边各框出16像素宽,就会得到一个224×224的图像。

它使用了局部响应归一化和dropout正则化,丢弃概率为0.5。所有权重初始化为均值为0、标准差为0.01的高斯分布。卷积层2、4、5以及所有全连接层中的偏置初始化为常数1,以避免ReLU死亡问题。

在测试时,为了使用训练好的AlexNet预测图像的类别,首先将该图像缩放,使其较短边长度为256。然后裁剪出中央的256×256块。接着,计算五个224×224块(四个角块和中心块)及其水平翻转,共10个块。网络对所有10个块的预测概率进行平均,这就是最终的预测概率。

ImageNet竞赛

用于参加2012年ImageNet竞赛的版本是7个AlexNet的集成。具体来说,他们在ILSVRC-2012训练集(120万张图像)上训练了5个前述架构(5个CONV层)的AlexNet。他们还训练了2个变体AlexNet,通过在最后一个池化层之上添加一个额外的CONV层获得。这些变体首先在完整的ImageNet Fall 2011版本(22K个类别中的1500万张图像)上训练,然后在ILSVRC-2012训练集上进行微调。最终的7个AlexNet系统通过平均其预测概率来使用。

历史

先前工作

1980年,福岛邦彦提出了一种早期的CNN,称为neocognitron。它通过无监督学习算法进行训练。LeNet-5(Yann LeCun等人,1989年)使用反向传播算法进行监督学习训练,其架构本质上与AlexNet在小规模上相同。最大池化在1990年被用于语音处理(本质上是一维CNN),在图像处理中,则首次用于1992年的Cresceptron。

在2000年代,随着GPU硬件的改进,一些研究人员将其用于通用计算,包括神经网络训练。K. Chellapilla等人(2006年)在GPU上训练了一个CNN,其速度比等效的CPU实现快4倍。Raina等人(2009年)在Nvidia GeForce GTX 280上训练了一个具有1亿参数的深度信念网络,速度比CPU快达70倍。Dan Cireșan等人(2011年)在IDSIA的深度CNN比等效的CPU实现快60倍。在2011年5月15日至2012年9月10日期间,他们的CNN赢得了四次图像竞赛,并在多个图像数据库上达到了最先进水平。根据AlexNet论文,Cireșan早期的网络“有些相似”。两者都是用CUDA编写以在GPU上运行。

计算机视觉

在1990年至2010年期间,神经网络并不优于其他机器学习方法,如核回归、支持向量机和其他经典技术。AlexNet在ILSVRC-2012中的决定性胜利证明了深度CNN可以大幅超越这些方法,导致了计算机视觉领域的范式转变。该架构的成功促进了深度学习在该领域的迅速采用,影响了后续架构,如ResNet等。

遗产

AlexNet的影响超出了计算机视觉领域,催化了更广泛的人工智能繁荣。它展示了深度学习在大规模上的有效性,鼓励了对基于GPU的计算的投资以及CUDA等框架的开发。深度CNN的原理,包括分层特征学习,后来被应用于其他领域,包括自然语言处理中的transformer大型语言模型。该论文仍是该领域被引用最多的论文之一,其作者,,Krizhevsky、Sutskever和Hinton,,后来都取得了有影响力的职业生涯,其中Sutskever联合创立了OpenAI,Hinton则成为AI研究的杰出人物。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·computer-vision·neural-network·imagenet
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史