En apprentissage automatique, le réseau autoroutier (Highway Network) est une architecture de réseau de neurones feedforward profond qui a été la première à entraîner avec succès des réseaux comportant des centaines de couches, dépassant largement les 20 à 30 couches typiques des modèles de pointe en 2014. Il a été introduit en mai 2015 par des chercheurs cherchant à surmonter le problème de « dégradation », où l'empilement de trop nombreuses couches entraînait une forte réduction de la précision d'entraînement. L'architecture utilise des mécanismes de gating appris pour réguler le flux d'informations à travers les couches, inspirés des réseaux de neurones récurrents à mémoire à long terme (LSTM). Ces portes créent des « autoroutes d'information » qui permettent aux gradients de se propager plus facilement, atténuant le problème du gradient vanishing et améliorant l'optimisation.
Le réseau autoroutier a été développé en même temps que le réseau neuronal résiduel (ResNet), publié en décembre 2015. ResNet peut être considéré comme un cas particulier du réseau autoroutier où les portes sont toujours ouvertes (activation 1.0). Les réseaux autoroutiers ont trouvé des applications pratiques dans l'étiquetage de séquences textuelles et la reconnaissance vocale.
Modèle et mécanisme de gating
Le réseau autoroutier étend une couche feedforward standard en ajoutant deux portes à côté de la fonction de transformation principale \(H(W_H, x)\) : une porte de transformation \(T(W_T, x)\) et une porte de report \(C(W_C, x)\). Les deux portes sont généralement des fonctions sigmoïdes, produisant des valeurs entre 0 et 1. La porte de report est définie comme \(C(W_C, x) = 1 - T(W_T, x)\), garantissant que les chemins de transformation et de report somment à un.
La sortie d'une couche autoroutière est calculée comme suit :
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot C(x, W_C)\)
ou de manière équivalente :
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot (1 - T(x, W_T))\)
Cette formulation permet à la couche de soit laisser passer l'entrée inchangée (lorsque la porte de transformation est proche de 0), soit appliquer une transformation non linéaire (lorsque la porte est proche de 1). Le gating est appris pendant l'entraînement, permettant au réseau de contrôler dynamiquement la quantité d'informations qui circule à travers chaque couche.
Relation avec LSTM et ResNet
Le réseau autoroutier s'inspire directement des réseaux de neurones récurrents LSTM. Sepp Hochreiter a analysé le problème du gradient vanishing en 1991, l'attribuant à la difficulté d'entraîner des réseaux profonds. Le LSTM original (1997) a introduit un carrousel d'erreur constant, une connexion résiduelle avec un poids fixe de 1.0, permettant aux gradients de circuler sur de longues étapes temporelles. Une variante ultérieure du LSTM (2000) a ajouté des « portes d'oubli » apprenables qui modulent ces connexions d'identité, abordant le problème du gradient vanishing de manière plus flexible.
Le réseau autoroutier applique ces principes aux réseaux feedforward. Il est analogue à un LSTM avec des portes d'oubli dépliées dans le temps, où les portes sont apprises. En revanche, ResNet, publié plus tard en décembre 2015, n'a pas d'équivalent des portes d'oubli ; ses connexions de saut sont toujours ouvertes, ressemblant au LSTM original de 1997. Si les portes d'un réseau autoroutier sont maintenues ouvertes (activation 1.0), il devient un ResNet.
La connexion résiduelle est un cas particulier du concept plus large de « connexion de raccourci » ou « connexion de saut », qui remonte à Rosenblatt (1961) et Lang & Witbrock (1988). Ces connexions prennent la forme \(x \mapsto F(x) + Ax\), où \(A\) est une matrice de poids. Dans une connexion résiduelle, \(A\) est la matrice identité, mais dans les connexions de saut générales, \(A\) peut être arbitraire. Ainsi, chaque connexion résiduelle est une connexion de saut, mais toutes les connexions de saut ne sont pas résiduelles.
Entraînement et performance
L'article original sur le réseau autoroutier a rapporté des expériences avec des réseaux de 20, 50 et 100 couches, et a mentionné des travaux en cours avec jusqu'à 900 couches. Le mécanisme de gating a permis d'entraîner efficacement ces réseaux très profonds, obtenant une meilleure optimisation que les réseaux profonds simples. En régulant le flux d'informations, les portes aident à prévenir le problème du gradient vanishing, où les gradients deviennent trop petits pour mettre à jour les poids dans les couches antérieures.
Comparé à d'autres architectures d'apprentissage profond, les réseaux autoroutiers offrent l'avantage d'une meilleure entraînabilité pour les modèles très profonds. Cependant, ils nécessitent des paramètres supplémentaires pour les portes, augmentant le coût de calcul. Le succès des réseaux autoroutiers et des ResNets a démontré que des architectures très profondes pouvaient être entraînées efficacement, ouvrant la voie à des avancées ultérieures en apprentissage profond.
Applications et héritage
Les réseaux autoroutiers ont été appliqués à l'étiquetage de séquences textuelles et à la reconnaissance vocale, où les architectures profondes sont bénéfiques pour capturer des motifs complexes. Ils ont également influencé le développement d'architectures ultérieures, telles que ResNet, qui est devenu un bloc de construction fondamental en vision par ordinateur. Le concept de connexions de saut avec gating a été adopté sous diverses formes dans l'apprentissage profond moderne, y compris dans les transformeurs et les grands modèles de langage.
Les idées derrière les réseaux autoroutiers font partie de l'évolution plus large de l'apprentissage profond, qui a été motivée par des contributions d'institutions comme l'Université de Toronto et des chercheurs tels que Sepp Hochreiter et Jürgen Schmidhuber. Bien que les réseaux autoroutiers eux-mêmes soient moins couramment utilisés aujourd'hui, leurs principes restent pertinents pour comprendre comment entraîner des réseaux de neurones très profonds.