在机器学习中,高速公路网络是一种深度前馈神经网络架构,它首次成功训练了具有数百层的网络,远超2014年最先进模型典型的20至30层。它于2015年5月由研究人员引入,旨在克服“退化”问题,即堆叠过多层会导致训练准确率急剧下降。该架构使用学习到的门控机制来调节跨层的信息流,灵感来自长短期记忆(LSTM)循环神经网络。这些门创建了“信息高速公路”,使梯度更容易传播,缓解了梯度消失问题并改善了优化。
高速公路网络与残差神经网络(ResNet)同时开发,后者于2015年12月发表。ResNet可以被视为高速公路网络的一个特例,其中门始终打开(激活值为1.0)。高速公路网络已在文本序列标注和语音识别任务中找到了实际应用。
模型与门控机制
高速公路网络通过在主变换函数\(H(W_H, x)\)旁边添加两个门来扩展标准前馈层:一个变换门\(T(W_T, x)\)和一个携带门\(C(W_C, x)\)。两个门通常都是sigmoid函数,输出值在0到1之间。携带门定义为\(C(W_C, x) = 1 - T(W_T, x)\),确保变换路径和携带路径之和为1。
高速公路层的输出计算如下:
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot C(x, W_C)\)
或等价地:
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot (1 - T(x, W_T))\)
这种公式允许层要么原样传递输入(当变换门接近0时),要么应用非线性变换(当门接近1时)。门控在训练过程中学习,使网络能够动态控制每层流动的信息量。
与LSTM和ResNet的关系
高速公路网络直接借鉴了LSTM循环神经网络。Sepp Hochreiter在1991年分析了梯度消失问题,将其归因于深度网络训练的困难。原始的LSTM(1997年)引入了恒定误差转盘,这是一种固定权重为1.0的残差连接,允许梯度跨长时间步流动。后来的LSTM变体(2000年)添加了可学习的“遗忘门”来调节这些恒等连接,更灵活地解决了梯度消失问题。
高速公路网络将这些原理应用于前馈网络。它类似于在时间上展开的带有遗忘门的LSTM,其中门是学习到的。相比之下,ResNet于2015年12月晚些时候发表,没有等效的遗忘门;其跳跃连接始终打开,类似于1997年的原始LSTM。如果高速公路网络中的门保持打开(激活值为1.0),它就变成了ResNet。
残差连接是更广泛的“捷径连接”或“跳跃连接”概念的一个特例,该概念可追溯到Rosenblatt(1961年)和Lang & Witbrock(1988年)。这些连接的形式为\(x \mapsto F(x) + Ax\),其中\(A\)是权重矩阵。在残差连接中,\(A\)是恒等矩阵,但在一般跳跃连接中,\(A\)可以是任意的。因此,每个残差连接都是跳跃连接,但并非所有跳跃连接都是残差的。
训练与性能
原始高速公路网络论文报告了20、50和100层网络的实验,并提到了正在进行的最多900层的工作。门控机制使这些非常深的网络能够有效训练,实现了比普通深度网络更好的优化。通过调节信息流,门有助于防止梯度消失问题,即梯度变得太小而无法更新早期层的权重。
与其他深度学习架构相比,高速公路网络提供了改善非常深模型可训练性的优势。然而,它们需要额外的门参数,增加了计算成本。高速公路网络和ResNet的成功证明了非常深的架构可以有效训练,为深度学习的后续进展铺平了道路。
应用与遗产
高速公路网络已应用于文本序列标注和语音识别,在这些任务中,深度架构有利于捕获复杂模式。它们还影响了后续架构的发展,例如ResNet,后者成为计算机视觉中的基础构建块。门控跳跃连接的概念已在现代深度学习的各种形式中被采用,包括在transformer和大型语言模型中。
高速公路网络背后的思想是深度学习更广泛演变的一部分,这一演变由多伦多大学等机构和Sepp Hochreiter、Jürgen Schmidhuber等研究人员推动。虽然高速公路网络本身如今使用较少,但其原理在理解如何训练非常深的神经网络方面仍然具有相关性。