AlexNet是由亚历克斯·克里热夫斯基在伊利亚·苏茨克弗和杰弗里·辛顿的协助下,于多伦多大学设计的一种卷积神经网络。它参加了2012年的ILSVRC-2012竞赛,将ImageNet照片分类为1,000个类别,其前五错误率为15.3%,比排名第二的参赛者高出十多个百分点,后者仍依赖传统的手工设计计算机视觉特征。这一结果被广泛视为现代深度学习时代的起点。
该网络名称是其第一作者名字的缩写,并非正式产品名称;论文本身通常仅被引用为“ImageNet Classification with Deep Convolutional Neural Networks”(2012年)。
历史
克里热夫斯基在辛顿的实验室中作为研究生构建了AlexNet,扩展了扬·勒昆在1990年代的早期卷积网络工作。卷积网络已存在二十年,而由李飞飞团队整理的ImageNet数据集自2009年起就已公开,但此前没有团队将足够深的网络与足够的计算能力和数据结合起来,以超越经典视觉流水线。克里热夫斯基在两张NVIDIA GPU显卡(GTX 580)上训练模型,由于单张显卡内存不足,他将网络拆分到两张卡上,并使用NVIDIA的CUDA平台自行编写底层内核。
架构
AlexNet有八个学习层:五个卷积层后接三个全连接层,总计约6000万个参数。若干设计选择使其区别于早期网络。它使用ReLU(修正线性单元)激活函数,而非速度较慢的饱和型sigmoid或tanh函数,这大大加快了训练速度。它在全连接层中应用了dropout,一种正则化技术,以减少在120万张训练图像数据集上的过拟合。它使用数据增强(随机裁剪和水平翻转)进一步限制过拟合,并在层间使用局部响应归一化,这一技术在后来的网络世代中大多被弃用。训练使用反向传播和随机梯度下降,在两张GPU上耗时约六天,这在当时对视觉模型而言是异常庞大的计算投入。
影响与遗产
AlexNet的显著胜出说服了计算机视觉领域的许多人,,该领域在第二次AI寒冬的挫折后一直对神经网络方法持怀疑态度,,使他们相信深度加规模加GPU计算是制胜组合。原始论文的引用次数达数万次,且该论文常被用作改变领域实证结果的典范教学案例。工业界迅速跟进:两年内,ImageNet挑战赛的大多数参赛者都使用了深度卷积网络,谷歌、Facebook和百度等公司建立了大型内部深度学习团队。NVIDIA的股票和战略在AlexNet之后发生转变,GPU越来越多地被用于训练而非仅用于图形渲染,这一关系在随后的十年中不断加深,网络从AlexNet的八层增长到数百层,后来又转向Transformer这一截然不同的架构。
AlexNet本身很快在后续的ImageNet竞赛中被更深的网络如VGGNet、GoogLeNet和ResNet所取代,而许多任务的卷积架构此后也面临视觉Transformer的挑战。其持久意义在于历史而非技术:它通常被视为说服更广泛的机器学习和计算机视觉社区大规模投入深度学习方法的单一关键结果,重塑了学术研究重点和支持它们的硬件产业。