La régularisation désigne une large famille de techniques utilisées en apprentissage automatique pour réduire le surapprentissage en décourageant un modèle de s'ajuster trop précisément aux données d'entraînement, afin qu'il généralise mieux aux nouvelles données. Plutôt que de modifier ce que le modèle cherche à apprendre, la plupart des méthodes de régularisation modifient la manière dont il est autorisé à apprendre, soit en pénalisant directement la complexité, soit en injectant un bruit contrôlé pendant l'entraînement, soit en arrêtant l'entraînement avant que le modèle n'ait l'occasion de mémoriser les particularités de l'ensemble d'entraînement.
Méthodes basées sur les poids
L'approche la plus ancienne et la plus directe ajoute un terme de pénalité à la fonction de perte basé sur la taille des poids du modèle, encourageant l'optimiseur à préférer des valeurs de poids plus petites et plus simples, sauf si les données justifient fortement des valeurs plus grandes. La régularisation L2, également appelée décroissance des poids ou régularisation ridge, pénalise la somme des poids au carré et tend à réduire tous les poids de manière progressive vers zéro. La régularisation L1 pénalise la somme des valeurs absolues des poids et tend à pousser certains poids exactement à zéro, effectuant ainsi une sélection de caractéristiques. Dans l'apprentissage profond moderne, la décroissance des poids est généralement appliquée directement dans l'optimiseur, par exemple comme une modification d'Adam connue sous le nom d'AdamW, plutôt que comme un terme explicite ajouté à la perte.
Méthodes structurelles et stochastiques
Le dropout, introduit par le groupe de Geoffrey Hinton vers 2012 et formalisé dans un article largement cité de 2014, désactive aléatoirement une fraction des unités d'un réseau de neurones à chaque étape d'entraînement, forçant le réseau à éviter de dépendre trop fortement d'une seule unité ou d'une combinaison fixe d'unités, et entraînant effectivement un ensemble implicite de sous-réseaux partageant des poids. La normalisation par lots et ses successeurs, bien qu'introduits principalement pour stabiliser et accélérer l'entraînement, ont également un effet secondaire régularisant en ajoutant du bruit aux entrées de chaque couche pendant l'entraînement. L'augmentation des données, qui crée des copies modifiées d'exemples d'entraînement, comme des images pivotées ou recadrées, ou du texte paraphrasé, élargit artificiellement la diversité effective des données d'entraînement et réduit la probabilité qu'un modèle s'accroche à des motifs superficiels et non généralisables.
Arrêt précoce et sélection de modèle
L'arrêt précoce interrompt l'entraînement une fois que la performance sur un ensemble de validation retenu cesse de s'améliorer, même si la perte d'entraînement continue de diminuer, ciblant directement la divergence entre la performance d'entraînement et celle de validation qui définit le surapprentissage. Cela nécessite de surveiller la perte de validation tout au long de l'entraînement plutôt que seulement à la fin, et c'est l'une des techniques de régularisation les plus simples et les plus largement utilisées précisément parce qu'elle ne nécessite aucun changement au modèle ou à la fonction de perte elle-même, seulement une règle d'arrêt.
Régularisation dans les grands modèles
De manière quelque peu contre-intuitive, les plus grands modèles de langage de grande taille et les systèmes d'apprentissage profond utilisent souvent une régularisation explicite plus légère que les modèles plus petits, car l'entraînement sur des données d'entraînement énormes et diverses avec un nombre limité de passages fournit une forme naturelle de régularisation : le modèle voit rarement, voire jamais, le même exemple deux fois, laissant peu d'opportunité de le mémoriser. Le dropout en particulier est souvent réduit ou entièrement supprimé lors du pré-entraînement à grande échelle des transformeurs, bien qu'il reste courant lors des étapes de réglage fin à plus petite échelle, où le surapprentissage sur un ensemble de données plus restreint est un risque plus réaliste.