Le sur-apprentissage

Traduit de l'anglais

Le surapprentissage se produit lorsqu'un modèle d'apprentissage automatique apprend les données d'entraînement trop précisément, y compris leur bruit, et en conséquence performe mal sur de nouvelles données non vues, malgré une faible erreur d'entraînement.

Le surapprentissage est un mode de défaillance en Machine learning dans lequel un modèle apprend les données d'entraînement trop fidèlement, y compris leur bruit et leurs idiosyncrasies, au détriment de l'apprentissage de schémas qui se généralisent à de nouvelles données non vues. Un modèle surajusté présente généralement une erreur très faible sur les données sur lesquelles il a été entraîné, mais une erreur sensiblement plus élevée sur des données exclues, ce qui est l'opposé de l'objectif visé, à savoir construire un modèle qui performe bien sur des exemples qu'il n'a jamais vus.

Causes

Le surapprentissage tend à se produire lorsqu'un modèle a une capacité suffisante, c'est-à-dire suffisamment de paramètres ou de flexibilité effective, pour mémoriser des détails idiosyncrasiques d'un ensemble d'entraînement fini plutôt que d'être contraint de trouver les schémas plus simples et plus généraux qui le sous-tendent. Il devient plus probable à mesure que le rapport entre la capacité du modèle et la taille des données d'entraînement augmente, ce qui explique pourquoi le surapprentissage était historiquement une préoccupation plus grande pour les petits ensembles de données et les modèles comparativement simples qu'il ne pourrait sembler pour les Large language models actuels, dont les ensembles d'entraînement sont énormes. Le surapprentissage peut également se produire de manière plus locale, par exemple lorsqu'un modèle est affiné sur un petit ensemble de données étroit après le Pretraining, où il peut perdre certaines de ses capacités plus larges tout en s'adaptant excessivement à l'ensemble d'affinage, un phénomène connexe parfois appelé oubli catastrophique. S'entraîner sur trop de passages sur les mêmes données, connu sous le nom de trop d'époques, est une cause directe classique, car un modèle avec une capacité suffisante passera progressivement de l'apprentissage de schémas généraux à la mémorisation d'exemples spécifiques plus il s'entraîne sur eux.

Détection

La méthode standard pour détecter le surapprentissage consiste à surveiller une Loss function sur un ensemble de validation, une portion de données exclue de l'entraînement, en parallèle de la perte d'entraînement. Tant que les deux pertes diminuent ensemble, le modèle généralise ; une fois que la perte d'entraînement continue de diminuer tandis que la perte de validation stagne ou augmente, le modèle a commencé à surajuster. Cette courbe de validation est la base de l'arrêt précoce, une technique qui interrompt l'entraînement près du point où la performance de validation est la meilleure, et pour choisir entre des architectures ou des réglages d'hyperparamètres concurrents en utilisant un ensemble de validation sur lequel le modèle n'a jamais été entraîné.

Atténuation

La famille générale de techniques pour prévenir ou réduire le surapprentissage est connue sous le nom de Regularization, qui comprend les pénalités de poids, l'abandon, l'augmentation des données et simplement la collecte de données plus nombreuses ou plus diversifiées Training data afin que les idiosyncrasies mémorisables aient moins d'importance par rapport aux schémas authentiques. La validation croisée, qui divise à plusieurs reprises les données en différentes partitions d'entraînement et de validation, donne une estimation plus robuste de la capacité de généralisation d'un modèle qu'une seule division entraînement-validation, et est une pratique standard pour les petits ensembles de données où un seul ensemble exclu serait lui-même bruité.

Surapprentissage au niveau des benchmarks

Une version connexe et de niveau supérieur du même problème affecte la manière dont tout le domaine mesure les progrès : lorsque les chercheurs ajustent à plusieurs reprises des modèles sur le même AI benchmark public au fil des ans, les résultats peuvent s'améliorer sur ce benchmark spécifique sans gains réels dans le monde réel, et les ensembles d'évaluation populaires risquent de fuir dans les Training data extraits du web, un problème appelé contamination des benchmarks ou des données. Cela a rendu les évaluations exclues et résistantes à la contamination, ainsi que les benchmarks comme ARC-AGI explicitement conçus pour résister à la mémorisation, de plus en plus importants pour mesurer honnêtement si les Large language models s'améliorent en raisonnement authentique plutôt qu'en surajustant à des distributions de test familières.

Catégories:machine-learning·model-evaluation·generalization
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique