Le grokking est un phénomène observé en apprentissage automatique, en particulier en apprentissage profond, où un réseau de neurones semble mémoriser les données d'entraînement pendant une période prolongée avant de passer brusquement à un état de généralisation authentique. Le terme, inventé par des chercheurs d'OpenAI en 2022, décrit une amélioration soudaine et souvent spectaculaire des performances sur des données non vues après une phase prolongée de surapprentissage apparent. Cette généralisation retardée contraste avec les dynamiques d'entraînement typiques, où les modèles s'améliorent progressivement ou atteignent un plateau tôt, et a des implications significatives pour comprendre comment les réseaux de neurones apprennent.
Le phénomène a été documenté pour la première fois de manière systématique dans un article de 2022 par Alethea Power et ses collègues d'OpenAI, qui ont étudié de petits modèles de transformeurs entraînés sur des tâches algorithmiques telles que l'arithmétique modulaire. Ils ont constaté qu'après que le modèle ait atteint une précision quasi parfaite sur les données d'entraînement, il continuait à s'entraîner pendant de nombreuses étapes supplémentaires sans amélioration visible sur les données de validation, pour soudainement atteindre une généralisation quasi parfaite. Cet événement de "grokking", nommé d'après le roman de Robert A. Heinlein de 1961 Stranger in a Strange Land (où "grok" signifie comprendre profondément), a depuis été reproduit sur diverses architectures et tâches, suscitant des recherches sur les mécanismes sous-jacents.
Caractéristiques et conditions
Le grokking se produit typiquement dans des modèles entraînés avec des conditions spécifiques : de petits ensembles de données, des tâches algorithmiques simples, et certaines techniques de régularisation. Le phénomène est le plus prononcé lorsque le modèle est entraîné avec un décroissance du poids, qui pénalise les grands poids, ou avec d'autres formes de régularisation comme l'abandon ou l'augmentation des données. Dans de nombreuses expériences, le grokking n'apparaît qu'après que le modèle ait complètement surappris les données d'entraînement, et la transition est souvent nette, se produisant en quelques centaines ou milliers d'étapes d'entraînement après un long plateau.
Le délai avant le grokking peut être substantiel, nécessitant parfois des ordres de grandeur de plus d'étapes d'entraînement que l'ajustement initial. Par exemple, dans les expériences originales d'arithmétique modulaire, les modèles ont pris des dizaines de milliers d'étapes pour mémoriser les données, puis ont atteint un plateau pendant des centaines de milliers d'étapes avant de généraliser soudainement. Ce comportement est sensible aux hyperparamètres : les modèles plus grands ont tendance à grokker plus rapidement, tandis que les modèles plus petits peuvent ne jamais grokker, et la présence de décroissance du poids est souvent cruciale.
Explications théoriques
Plusieurs théories ont été proposées pour expliquer le grokking, bien qu'aucun consensus n'existe en 2025. Une hypothèse prominente est que le grokking découle d'une compétition entre la mémorisation et la généralisation dans les représentations internes du modèle. Pendant la phase de plateau, le réseau encode les exemples d'entraînement de manière complexe et surapprise, mais la descente de gradient simplifie progressivement ces représentations, découvrant finalement une solution plus générale. Ce processus est analogue aux transitions de phase en physique, où un système se réorganise soudainement dans un état d'énergie plus faible.
Une autre ligne de travail, incluant des études de chercheurs de l'Université de Toronto et d'ailleurs, suggère que le grokking est lié à la géométrie du paysage de perte. Le modèle peut initialement être piégé dans un minimum pointu qui généralise mal, mais à mesure que l'entraînement continue, il s'échappe vers un minimum plus plat qui généralise mieux. La décroissance du poids encourage cette échappée en pénalisant les solutions pointues. De plus, certaines recherches ont lié le grokking à l'émergence de représentations modulaires ou structurées, telles que les caractéristiques de Fourier dans les tâches arithmétiques, qui permettent au modèle de calculer des réponses en utilisant des règles générales plutôt que des exemples mémorisés.
Implications pour l'apprentissage automatique
Le grokking remet en question la sagesse conventionnelle sur le surapprentissage et la généralisation. Dans la pratique standard, l'entraînement est arrêté lorsque les performances de validation atteignent un plateau, mais le grokking montre que continuer à s'entraîner peut produire des améliorations spectaculaires, même après une convergence apparente. Cela a des implications pratiques pour l'entraînement de grands modèles, où les budgets computationnels sont souvent limités. Si le grokking se produit dans des tâches du monde réel, cela pourrait signifier que certains modèles sont sous-entraînés et bénéficieraient de sessions d'entraînement plus longues, mais détecter le début du grokking est difficile car il est imprévisible et peut nécessiter un calcul excessif.
Le phénomène fournit également un banc d'essai pour étudier comment les réseaux de neurones passent de la mémorisation à la généralisation, ce qui est pertinent pour comprendre les capacités des grands modèles de langage et d'autres systèmes d'IA. Les chercheurs ont établi des parallèles entre le grokking et l'émergence soudaine de capacités dans les grands modèles, bien que la relation reste spéculative. Comprendre le grokking pourrait informer des techniques pour accélérer l'apprentissage, telles que l'apprentissage par curriculum ou la régularisation adaptative, et pourrait aider à concevoir des modèles qui généralisent plus fiablement.
Phénomènes connexes et directions de recherche
Le grokking est lié à d'autres dynamiques d'entraînement observées, telles que la "double descente", où les performances de test s'améliorent d'abord, puis se détériorent, puis s'améliorent à nouveau à mesure que la taille du modèle augmente. Les deux phénomènes mettent en évidence la nature non monotone de l'apprentissage dans les réseaux de neurones. Cependant, le grokking est distinct en ce qu'il se produit dans le temps pour un modèle fixe, plutôt que sur la taille du modèle. Un autre concept connexe est celui des "périodes d'apprentissage critiques" dans les systèmes biologiques, où certaines expériences doivent se produire à des moments spécifiques pour un développement approprié, ce que certains chercheurs ont comparé au moment des événements de grokking.
Les directions de recherche actuelles incluent l'investigation du grokking dans des modèles plus grands et des tâches plus complexes, telles que le traitement du langage naturel, où les preuves sont mitigées. Certaines études ont rapporté un comportement de type grokking dans des modèles de langage basés sur des transformeurs, mais d'autres ne l'ont pas observé, possiblement en raison de différences dans l'optimisation et l'échelle des données. Les chercheurs explorent également comment l'initialisation, les calendriers de taux d'apprentissage et les choix d'architecture affectent le grokking, avec l'objectif de développer des théories prédictives. En 2025, le grokking reste un domaine d'étude actif, avec des questions ouvertes sur son universalité, ses mécanismes et sa pertinence pratique.
Voir aussi
- apprentissage profond
- réseau de neurones
- transformeur
- OpenAI
- initialisation du poids
- apprentissage par curriculum
- augmentation des données
- élagage de modèle
Références
Power, A., Burda, Y., Edwards, H., Babuschkin, I., & Misra, V. (2022). Grokking: Generalization beyond overfitting on small algorithmic datasets. arXiv preprint arXiv:2201.02177.
Nanda, N., Chan, L., Lieberum, T., Smith, J., & Steinhardt, J. (2023). Progress measures for grokking via mechanistic interpretability. arXiv preprint arXiv:2301.05217.
Varma, V., Das, R., Schmidt, D., & Shah, N. (2023). Explaining grokking through circuit efficiency. arXiv preprint arXiv:2309.02390.