L'apprentissage résiduel profond, communément appelé ResNet, est une architecture de Deep learning introduite en 2015 pour la reconnaissance d'images. Elle a remporté le défi de reconnaissance visuelle à grande échelle ImageNet (ILSVRC) de cette année-là, démontrant que des réseaux comportant des centaines de couches pouvaient être entraînés efficacement. L'innovation clé réside dans la connexion résiduelle, qui permet aux couches d'apprendre des fonctions résiduelles par rapport à leurs entrées, stabilisant ainsi l'entraînement et la convergence dans les réseaux neuronaux très profonds.
Le motif de connexion résiduelle, défini comme \(x \mapsto f(x) + x\) où \(f\) est un module de réseau neuronal arbitraire, avait été utilisé dans des travaux antérieurs, mais la publication de ResNet l'a rendu largement populaire pour les réseaux à propagation avant. Ce motif apparaît désormais dans de nombreuses architectures apparemment sans rapport avec ResNet, notamment les modèles Transformer (architecture) tels que BERT et GPT, ainsi que des systèmes comme AlphaGo Zero, AlphaStar et AlphaFold.
Mathématiques des connexions résiduelles
Dans un réseau neuronal multicouche, considérons un sous-réseau avec des couches empilées (par exemple, 2 ou 3). Soit \(H(x; \alpha)\) le sous-réseau, où \(x\) est l'entrée et \(\alpha\) l'ensemble des paramètres. Si \(H^\) est la sortie optimale souhaitée, l'apprentissage résiduel ajoute \(x\) directement à la sortie, de sorte que la sortie optimale apprise devient \(H^ - x\), interprétée comme un « résidu » par rapport à \(x\). Cela est implémenté via une connexion de saut qui effectue une mise en correspondance identité de l'entrée du sous-réseau vers sa sortie.
La fonction \(F(x; \alpha) = H(x; \alpha) + x\) est souvent représentée par une multiplication matricielle entrelacée avec des fonctions d'activation et des opérations de normalisation telles que la normalisation par lots ou la normalisation de couche. Un bloc résiduel est un tel sous-réseau, et un réseau résiduel profond est construit en empilant ces blocs.
Les réseaux de mémoire à long terme (LSTM) disposent d'un mécanisme de mémoire qui sert de connexion résiduelle. Dans un LSTM sans porte d'oubli, une entrée \(x_t\) est traitée par une fonction \(F\) et ajoutée à une cellule mémoire \(c_t\), ce qui donne \(c_{t+1} = c_t + F(x_t)\). Un LSTM avec une porte d'oubli fonctionne essentiellement comme un réseau autoroutier.
Pour stabiliser la variance des entrées de couche, il est recommandé de remplacer les connexions résiduelles \(x + f(x)\) par \(x/L + f(x)\), où \(L\) est le nombre total de couches résiduelles.
Connexions de projection
Lorsque la fonction \(F\) mappe de \(\mathbb{R}^n\) vers \(\mathbb{R}^m\) avec \(n \neq m\), l'expression \(F(x) + x\) n'est pas définie. Dans ce cas, une connexion de projection est utilisée : \(y = F(x) + P(x)\), où \(P\) est typiquement une projection linéaire définie par \(P(x) = Mx\), avec \(M\) une matrice \(m \times n\). La matrice \(M\) est entraînée via la Backpropagation, comme tout autre paramètre de modèle.
Propagation du signal
L'introduction de mises en correspondance identité facilite la propagation du signal dans les chemins avant et arrière. Dans le sens avant, si la sortie du \(\ell\)-ième bloc résiduel est l'entrée du bloc \((\ell+1)\)-ième (en supposant qu'aucune activation ne se situe entre les blocs), alors l'entrée du bloc suivant est \(x_{\ell+1} = F(x_\ell) + x_\ell\). Cette structure additive permet aux gradients de circuler directement à travers le réseau pendant la rétropropagation, atténuant le problème de gradient qui s'estompe qui affectait les architectures profondes antérieures.
Impact et héritage
Le succès de ResNet à l'ILSVRC 2015 a marqué un tournant dans la vision par ordinateur et l'intelligence artificielle. Il a permis l'entraînement de réseaux comportant des centaines de couches, ce qui était auparavant irréalisable en raison de la dégradation de la précision d'entraînement. La connexion résiduelle est depuis devenue un composant standard dans de nombreux modèles d'apprentissage profond, y compris ceux utilisés dans le traitement du langage naturel et l'IA générative.
L'influence de l'architecture s'étend au-delà de la reconnaissance d'images. Les connexions résiduelles sont intégrales aux grands modèles de langage modernes et à d'autres modèles basés sur des séquences, où elles aident à maintenir un entraînement stable sur de nombreuses couches. Le principe d'apprendre des résidus plutôt que des transformations complètes a également inspiré des variations telles que le U-Net et d'autres conceptions encodeur-décodeur.
ResNet reste une référence fondamentale dans l'apprentissage profond, et ses principes de conception sont enseignés dans les cours et appliqués dans la recherche à travers les domaines du apprentissage automatique. La simplicité et l'efficacité de la connexion résiduelle en ont fait l'une des contributions les plus durables au domaine.