Mathématiques
Connexion résiduelle
Dans un réseau de neurones multicouches, considérons un sous-réseau avec quelques couches empilées, noté \(H(x; \alpha)\), où \(x\) est l'entrée et \(\alpha\) les paramètres. Dans l'apprentissage standard, le sous-réseau vise à approximer une sortie souhaitée \(H^\). L'apprentissage résiduel modifie le sous-réseau pour produire \(F(x; \alpha) = H(x; \alpha) + x\), de sorte que la fonction optimale apprise devient \(H^ - x\), interprétée comme le résidu par rapport à \(x\). L'addition de \(x\) est réalisée via une connexion de saut qui effectue une application identité, reliant directement l'entrée du sous-réseau à sa sortie. Cette connexion de saut est appelée connexion résiduelle. Le sous-réseau, avec sa connexion résiduelle, forme un bloc résiduel. Un réseau résiduel profond est construit en empilant plusieurs de ces blocs.
La connexion résiduelle stabilise l'entraînement en facilitant la propagation du gradient, ce qui est particulièrement important pour les réseaux comportant des centaines de couches. Les réseaux à mémoire à long terme (LSTM) possèdent un mécanisme de mémoire qui agit comme une connexion résiduelle : dans un LSTM sans porte d'oubli, la règle de mise à jour est \(c_{t+1} = c_t + F(x_t)\), où \(c_t\) est la cellule de mémoire et \(F\) une fonction de l'entrée. Un LSTM avec porte d'oubli fonctionne de manière similaire à un réseau autoroutier. Pour stabiliser la variance, il est recommandé de mettre à l'échelle la connexion résiduelle par \(1/L\), où \(L\) est le nombre total de couches résiduelles, ce qui donne \(x/L + f(x)\).
Connexion de projection
Lorsque la fonction \(F\) mappe de \(\mathbb{R}^n\) vers \(\mathbb{R}^m\) avec \(n \neq m\), l'addition \(F(x) + x\) n'est pas définie. Dans ce cas, on utilise une connexion de projection : \(y = F(x) + P(x)\), où \(P\) est généralement une projection linéaire définie par \(P(x) = Mx\), avec \(M\) une matrice de taille \(m \times n\). La matrice \(M\) est entraînée par rétropropagation avec les autres paramètres du modèle.
Propagation du signal
L'application identité dans les connexions résiduelles facilite la propagation du signal dans les directions avant et arrière. Dans la passe avant, si la sortie du \(\ell\)-ième bloc résiduel est l'entrée du \((\ell+1)\)-ième bloc (en supposant aucune activation entre les blocs), alors l'entrée du bloc suivant est \(x_{\ell+1} = F(x_\ell) + x_\ell\). Cette structure additive permet à l'information de circuler directement à travers le réseau, atténuant le problème du gradient vanishing.
Impact sur l'apprentissage profond
L'introduction de ResNet en 2015 a marqué une étape importante dans l'apprentissage profond. Avant ResNet, l'entraînement de réseaux très profonds était difficile en raison de la dégradation de la précision à mesure que la profondeur augmentait. Le cadre d'apprentissage résiduel de ResNet a résolu ce problème en reformulant les couches comme apprenant des fonctions résiduelles, plus faciles à optimiser. L'architecture a obtenu des résultats de pointe lors du défi ILSVRC 2015, avec un taux d'erreur de 3,57 % sur l'ensemble de test d'ImageNet, surpassant les performances humaines sur certaines tâches.
Le succès de ResNet a stimulé le développement d'architectures encore plus profondes, telles que ResNet-50, ResNet-101 et ResNet-152, largement utilisées comme réseaux de base dans des tâches de vision par ordinateur comme la détection d'objets et la segmentation. Le concept de connexion résiduelle a également été adopté dans d'autres domaines, notamment le traitement du langage naturel et l'apprentissage par renforcement.
Héritage et influence
La connexion résiduelle est devenue un élément fondamental dans la conception des réseaux de neurones modernes. Elle est un composant clé des architectures de transformeurs, qui alimentent les grands modèles de langage tels que GPT et BERT. La technique est également utilisée dans des systèmes comme AlphaGo Zero, AlphaStar et AlphaFold, démontrant sa polyvalence à travers différents types de réseaux de neurones.
La publication de l'article ResNet, intitulé « Deep Residual Learning for Image Recognition », a été rédigée par Kaiming He, Xiangyu Zhang, Shaoqing Ren et Jian Sun. Il est devenu l'un des articles les plus cités en vision par ordinateur et en apprentissage profond, influençant les recherches ultérieures sur l'architecture des réseaux et la stabilité de l'entraînement.