残差网络(Residual Network,简称ResNet)是一种深度学习架构,其中各层学习相对于其输入的残差函数。该架构于2015年为图像识别任务而开发,并在当年的ImageNet大规模视觉识别挑战赛(ILSVRC)中夺冠。其关键创新在于残差连接,这是一种将子网络的输入与其输出相加的架构模式,从而使得训练包含数百层的网络成为可能。
残差连接稳定了深度神经网络的训练与收敛过程,使其成为现代架构中的常见模式,例如Transformer (architecture)模型(如BERT和GPT系列模型,包括ChatGPT),以及AlphaGo Zero、AlphaStar和AlphaFold等系统。其影响已超越图像识别领域,延伸至Deep learning的各个应用方向。
残差连接的数学原理
在多层的神经网络中,考虑一个由堆叠层组成的子网络(例如2层或3层)。设\(H(x; \alpha)\)表示该子网络,其中\(x\)为输入,\(\alpha\)为参数。若\(H^\)为期望的最优输出,残差学习通过将输入\(x\)直接加到输出上,使得网络学习的目标变为\(H^ - x\),即相对于\(x\)的“残差”。这种将输入\(x\)直接相加的操作通过跳跃连接(skip connection)实现,该连接执行恒等映射,将子网络的输入直接连接到其输出。这一连接后来被称为“残差连接”。
函数\(F(x; \alpha) = H(x; \alpha) + x\)通常由矩阵乘法与激活函数及归一化操作(如批归一化或层归一化)交替构成。这样的子网络被称为“残差块”,而深度残差网络则由多个残差块堆叠而成。
长短期记忆网络(LSTM)中的记忆机制可视为一种残差连接。在无遗忘门的LSTM中,输入\(x_t\)经处理后的结果\(F\)直接与记忆单元\(c_t\)相加,得到\(c_{t+1} = c_t + F(x_t)\)。而带遗忘门的LSTM则本质上类似于高速公路网络(highway network)。
为稳定各层输入的方差,建议将残差连接\(x + f(x)\)替换为\(x/L + f(x)\),其中\(L\)为残差层的总数。
投影连接
当函数\(F\)的映射维度从\(\mathbb{R}^n\)变为\(\mathbb{R}^m\)且\(n \neq m\)时,表达式\(F(x) + x\)因维度不匹配而无法直接相加。此时需使用投影连接:\(y = F(x) + P(x)\),其中\(P\)通常为线性投影,定义为\(P(x) = Mx\),\(M\)为\(m \times n\)的矩阵。该矩阵与其他参数一样,通过反向传播进行训练。
信号传播
恒等映射的引入促进了信号在前向和反向传播中的流动。在前向传播中,若第\(\ell\)个残差块的输出作为第\((\ell+1)\)个残差块的输入,且块间无激活函数,则下一输入为\(x_{\ell+1} = F(x_\ell) + x_\ell\)。这种加性结构使得梯度能够直接通过网络反向流动,从而缓解了早期深度网络中常见的梯度消失问题。
历史背景与发展
残差连接的模式在ResNet之前已有应用,例如在LSTM网络和高速公路网络中。然而,2015年发表的ResNet论文使其在前馈网络中广泛普及,并推动了图像识别领域的发展。该论文由何恺明、张翔宇、任少卿和孙剑共同撰写,提出了深度残差学习,并在ILSVRC 2015中取得了当时最先进的成果。
对深度学习的影响
ResNet的成功证明了极深网络可以被有效训练,从而引发了Neural network设计范式的转变。残差连接成为后续架构中的标准组件,包括Transformer (architecture)模型(用于Large language model)。例如,BERT和GPT模型依赖残差连接来训练深层Transformer。此外,AlphaGo Zero、AlphaStar和AlphaFold等系统也采用了残差块,展现了该模式的广泛适用性。
变体与扩展
研究者提出了多种残差网络的变体。预激活ResNet将批归一化和激活函数移至权重层之前,从而改善了训练效果。宽残差网络通过增加宽度而非深度来提升性能,同时减少层数。密集连接网络(DenseNet)将每一层与后续所有层直接相连,在残差思想的基础上进一步发展。ResNeXt引入了基数(cardinality)概念,将卷积拆分为并行路径,进一步丰富了残差网络的灵活性。
实践考量
在实际应用中,残差连接通常通过跳跃连接实现,当维度变化时可能需要引入投影矩阵。批归一化等归一化技术常被应用于残差块内部。激活函数(如ReLU)的选择也会影响训练动态。残差连接还允许使用更高的学习率,并降低了对初始化方式的敏感性,从而保持了信号方差的稳定性。
遗产与未来方向
残差网络已成为Deep learning领域的奠基性概念,深刻影响了学术研究与工业应用。其原理已融入现代框架与硬件优化之中。截至2020年代初,残差连接仍是众多架构(包括Generative AI和Artificial intelligence系统)中的默认选择。学习残差的思想也启发了Machine learning理论与优化方法的其他研究方向。