Un réseau neuronal résiduel, également connu sous le nom de réseau résiduel ou ResNet, est une architecture d'apprentissage profond dans laquelle les couches apprennent des fonctions résiduelles par rapport à leurs entrées. Développé en 2015 pour la reconnaissance d'images, il a remporté le concours ImageNet Large Scale Visual Recognition Challenge (ILSVRC) de cette année-là. L'innovation clé est la connexion résiduelle, un motif architectural qui ajoute l'entrée d'un sous-réseau à sa sortie, permettant l'entraînement de réseaux avec des centaines de couches.
La connexion résiduelle stabilise l'entraînement et la convergence dans les réseaux neuronaux profonds, ce qui en fait un motif courant dans les architectures modernes telles que les modèles transformers (par exemple, BERT et les modèles GPT comme ChatGPT), ainsi que des systèmes comme AlphaGo Zero, AlphaStar et AlphaFold. Son impact s'étend au-delà de la reconnaissance d'images, influençant le apprentissage profond dans divers domaines.
Mathématiques des connexions résiduelles
Dans un réseau neuronal multicouche, considérons un sous-réseau avec des couches empilées (par exemple, 2 ou 3). Soit \(H(x; \alpha)\) le sous-réseau, où \(x\) est l'entrée et \(\alpha\) l'ensemble des paramètres. Si \(H^\) est la sortie optimale souhaitée, l'apprentissage résiduel ajoute \(x\) directement à la sortie, de sorte que la sortie optimale apprise devient \(H^ - x\), interprétée comme un « résidu » par rapport à \(x\). L'opération d'ajout de \(x\) est implémentée via une connexion de saut qui effectue une cartographie d'identité, reliant l'entrée du sous-réseau à sa sortie. Cette connexion est ensuite appelée « connexion résiduelle ».
La fonction \(F(x; \alpha) = H(x; \alpha) + x\) est souvent représentée par une multiplication matricielle entrelacée avec des fonctions d'activation et des opérations de normalisation (par exemple, la normalisation par lots ou la normalisation de couche). Un tel sous-réseau est appelé « bloc résiduel », et un réseau résiduel profond empile ces blocs.
Les réseaux de mémoire à long terme (LSTM) ont un mécanisme de mémoire qui sert de connexion résiduelle. Dans un LSTM sans porte d'oubli, une entrée \(x_t\) est traitée par \(F\) et ajoutée à une cellule mémoire \(c_t\), donnant \(c_{t+1} = c_t + F(x_t)\). Un LSTM avec une porte d'oubli fonctionne essentiellement comme un réseau autoroutier.
Pour stabiliser la variance des entrées de couche, il est recommandé de remplacer les connexions résiduelles \(x + f(x)\) par \(x/L + f(x)\), où \(L\) est le nombre total de couches résiduelles.
Connexions de projection
Si la fonction \(F\) mappe de \(\mathbb{R}^n\) à \(\mathbb{R}^m\) avec \(n \neq m\), l'expression \(F(x) + x\) est indéfinie. Pour gérer cela, une connexion de projection est utilisée : \(y = F(x) + P(x)\), où \(P\) est généralement une projection linéaire définie par \(P(x) = Mx\), avec \(M\) une matrice \(m \times n\). La matrice est entraînée par rétropropagation comme tout autre paramètre.
Propagation du signal
L'introduction de cartographies d'identité facilite la propagation du signal dans les chemins avant et arrière. En propagation avant, si la sortie du \(\ell\)-ième bloc résiduel est l'entrée du bloc \((\ell+1)\)-ième (en supposant aucune activation entre les blocs), alors l'entrée suivante est \(x_{\ell+1} = F(x_\ell) + x_\ell\). Cette structure additive permet aux gradients de circuler directement à travers le réseau, atténuant le problème de gradient qui s'estompe qui affectait les réseaux profonds antérieurs.
Contexte historique et développement
Le motif de connexion résiduelle avait été utilisé avant ResNet, par exemple dans les réseaux LSTM et les réseaux autoroutiers. Cependant, la publication de ResNet en 2015 l'a rendu largement populaire pour les réseaux à propagation avant, apparaissant dans des architectures apparemment sans rapport avec la reconnaissance d'images. L'article original sur ResNet, écrit par Kaiming He, Xiangyu Zhang, Shaoqing Ren et Jian Sun, a introduit l'apprentissage résiduel profond pour la reconnaissance d'images et a obtenu des résultats de pointe sur ILSVRC 2015.
Impact sur l'apprentissage profond
Le succès de ResNet a démontré que des réseaux très profonds pouvaient être entraînés efficacement, entraînant un changement dans la conception des réseaux neuronaux. La connexion résiduelle est devenue un composant standard dans les architectures ultérieures, y compris les modèles transformers utilisés dans les grands modèles de langage. Par exemple, les modèles BERT et GPT s'appuient sur des connexions résiduelles pour entraîner des transformers profonds. Des systèmes comme AlphaGo Zero et AlphaFold intègrent également des blocs résiduels, montrant la polyvalence du motif.
Variantes et extensions
Plusieurs variantes de réseaux résiduels ont été proposées. Les ResNets à pré-activation déplacent la normalisation par lots et l'activation avant les couches de poids, améliorant l'entraînement. Les Wide ResNets augmentent la largeur plutôt que la profondeur, obtenant de meilleures performances avec moins de couches. DenseNet connecte chaque couche à toutes les couches suivantes, s'appuyant sur l'idée résiduelle. ResNeXt introduit la cardinalité, divisant les convolutions en chemins parallèles. Ces variantes mettent en évidence la flexibilité du concept résiduel.
Considérations pratiques
En pratique, les connexions résiduelles sont implémentées avec des connexions de saut qui peuvent inclure des matrices de projection lorsque les dimensions changent. Des techniques de normalisation comme la normalisation par lots sont souvent appliquées dans les blocs résiduels. Le choix des fonctions d'activation, comme ReLU, affecte la dynamique d'entraînement. Les connexions résiduelles permettent également l'utilisation de taux d'apprentissage plus élevés et réduisent la sensibilité à l'initialisation, car elles maintiennent la variance du signal stable.
Héritage et orientations futures
Le réseau résiduel est devenu un concept fondamental dans le apprentissage profond, influençant à la fois la recherche académique et les applications industrielles. Ses principes sont intégrés dans les frameworks modernes et les optimisations matérielles. Au début des années 2020, les connexions résiduelles restent un choix par défaut dans de nombreuses architectures, y compris celles pour les systèmes de IA générative et d'intelligence artificielle. L'idée d'apprendre des résidus a également inspiré d'autres domaines, tels que la théorie du apprentissage automatique et l'optimisation.