ResNet 论文(2015年)

译自英文

ResNet是一种使用残差连接的深度学习架构,于2015年提出,用于图像识别,并在ILSVRC 2015中获胜。。

残差神经网络,通常称为ResNet,是一类深度学习架构,通过引入跳跃连接(将层的输入加到其输出上)来训练非常深的神经网络。该架构于2015年为图像识别而开发,并赢得了当年的ImageNet大规模视觉识别挑战赛(ILSVRC)。其关键创新在于残差连接,它使各层能够参照层输入学习残差函数,从而稳定训练并支持数百层网络的构建。

残差连接的模式,定义为\(x \mapsto f(x) + x\),在早期模型中已有使用,但ResNet的发表使其在前馈网络中广泛流行。此后,它成为许多深度神经网络架构的常见组成部分,包括像BERT和GPT这样的Transformer模型,以及AlphaGo Zero、AlphaStar和AlphaFold等系统。

数学

残差连接

在多层神经网络中,考虑一个由几层堆叠而成的子网络,记为\(H(x; \alpha)\),其中\(x\)是输入,\(\alpha\)是参数。在标准学习中,该子网络旨在逼近期望输出\(H^\)。残差学习修改子网络,使其输出\(F(x; \alpha) = H(x; \alpha) + x\),因此最优学习函数变为\(H^ - x\),这被解释为相对于\(x\)的残差。\(x\)的加法通过跳跃连接实现,该连接执行恒等映射,将子网络的输入直接连接到其输出。这种跳跃连接被称为残差连接。子网络连同跳跃连接一起构成残差块。深度残差网络通过堆叠多个这样的块来构建。

残差连接通过促进梯度流动来稳定训练,这对于数百层网络尤为重要。长短期记忆(LSTM)网络具有一种记忆机制,其作用类似于残差连接:在没有遗忘门的LSTM中,更新规则为\(c_{t+1} = c_t + F(x_t)\),其中\(c_t\)是记忆单元,\(F\)是输入的函数。带有遗忘门的LSTM功能类似于高速公路网络。为稳定方差,建议将残差连接按\(1/L\)缩放,其中\(L\)是残差层的总数,得到\(x/L + f(x)\)。

投影连接

当函数\(F\)从\(\mathbb{R}^n\)映射到\(\mathbb{R}^m\)且\(n \neq m\)时,加法\(F(x) + x\)未定义。在这种情况下,使用投影连接:\(y = F(x) + P(x)\),其中\(P\)通常是由\(P(x) = Mx\)定义的线性投影,\(M\)是一个\(m \times n\)矩阵。矩阵\(M\)通过反向传播与模型的其他参数一起训练。

信号传播

残差连接中的恒等映射有助于信号在前向和反向两个方向上的传播。在前向传播中,如果第\(\ell\)个残差块的输出是第\((\ell+1)\)个块的输入(假设块之间没有激活),则下一个块的输入为\(x_{\ell+1} = F(x_\ell) + x_\ell\)。这种加性结构允许信息直接流过网络,从而缓解梯度消失问题。

对深度学习的影响

2015年ResNet的引入标志着深度学习的一个重要里程碑。在ResNet之前,训练非常深的网络因深度增加导致精度下降而面临挑战。ResNet的残差学习框架通过将层重新表述为学习残差函数来解决这一问题,这些函数更易于优化。该架构在ILSVRC 2015挑战赛中取得了最先进的结果,在ImageNet测试集上错误率为3.57%,在某些任务上超越了人类水平的表现。

ResNet的成功推动了更深层架构的发展,如ResNet-50、ResNet-101和ResNet-152,这些架构被广泛用作计算机视觉任务(如目标检测和分割)中的骨干网络。残差连接的概念已被应用于其他各个领域,包括自然语言处理和强化学习。

遗产与影响

残差连接已成为现代神经网络设计中的基本构建块。它是Transformer架构中的关键组件,这些架构支撑着GPT和BERT等大型语言模型。该技术还用于AlphaGo Zero、AlphaStar和AlphaFold等系统,展示了其在不同类型神经网络中的通用性。

ResNet论文的发表,题为“Deep Residual Learning for Image Recognition”,作者为Kaiming He、Xiangyu Zhang、Shaoqing Ren和Jian Sun。它已成为计算机视觉和深度学习领域被引用最多的论文之一,影响了后续关于网络架构和训练稳定性的研究。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·neural-network·computer-vision·residual-network
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史