Taux d’apprentissage planifié

Traduit de l'anglais

Un planificateur de taux d'apprentissage ajuste le taux d'apprentissage pendant l'entraînement d'un réseau de neurones pour améliorer la convergence et éviter les minima locaux. Les calendriers courants incluent la décroissance temporelle, la décroissance par étapes et la décroissance exponentielle, ainsi que des méthodes adaptatives telles qu'Adam.

En apprentissage automatique et en statistiques, le taux d'apprentissage est un paramètre de réglage dans un algorithme d'optimisation qui détermine la taille du pas à chaque itération lors de la progression vers un minimum d'une fonction de perte. Comme il influence la mesure dans laquelle les informations nouvellement acquises priment sur les anciennes, il représente métaphoriquement la vitesse à laquelle un modèle d'apprentissage automatique « apprend ». Dans la littérature sur le contrôle adaptatif, le taux d'apprentissage est couramment désigné sous le terme de gain.

Le réglage d'un taux d'apprentissage implique un compromis entre la vitesse de convergence et le risque de dépassement. Alors que la direction de descente est généralement déterminée à partir du gradient de la fonction de perte, le taux d'apprentissage détermine l'ampleur du pas effectué dans cette direction. Un taux d'apprentissage trop élevé fera sauter l'optimisation par-dessus les minima, tandis qu'un taux trop faible entraînera soit une convergence trop lente, soit un blocage dans un minimum local indésirable. Pour obtenir une convergence plus rapide, éviter les oscillations et ne pas rester piégé dans des minima locaux indésirables, le taux d'apprentissage est souvent modifié au cours de l'entraînement, soit selon un calendrier prédéfini, soit en utilisant un taux d'apprentissage adaptatif. Le taux d'apprentissage et ses ajustements peuvent également varier selon les paramètres, auquel cas il s'agit d'une matrice diagonale pouvant être interprétée comme une approximation de l'inverse de la matrice hessienne dans la méthode de Newton. Le taux d'apprentissage est lié à la longueur de pas déterminée par la recherche linéaire inexacte dans les méthodes quasi-Newton et les algorithmes d'optimisation associés.

Calendriers de taux d'apprentissage

Le taux initial peut être laissé à une valeur par défaut du système ou choisi à l'aide de diverses techniques. Un calendrier de taux d'apprentissage modifie le taux au cours de l'apprentissage, le plus souvent entre les époques ou les itérations. Cela se fait principalement à l'aide de deux paramètres : la décroissance et l'élan. Il existe de nombreux calendriers de taux d'apprentissage, mais les plus courants sont basés sur le temps, sur des paliers, ou exponentiels.

La décroissance sert à stabiliser l'apprentissage et à éviter les oscillations, une situation qui peut survenir lorsqu'un taux d'apprentissage constant est trop élevé, faisant osciller l'optimisation autour d'un minimum. Elle est contrôlée par un hyperparamètre.

L'élan est analogue à une balle dévalant une colline ; l'objectif est que la balle se stabilise au point le plus bas de la colline (correspondant à l'erreur la plus faible). L'élan accélère l'apprentissage (en augmentant le taux d'apprentissage effectif) lorsque le gradient de l'erreur pointe dans la même direction pendant une longue période, et évite également les minima locaux en « survolant » les petites bosses. L'élan est contrôlé par un hyperparamètre analogue à la masse de la balle, qui doit être choisi manuellement – trop élevé, la balle survolera les minima que l'on souhaite atteindre ; trop faible, elle ne remplira pas son rôle. La formule pour intégrer l'élan est plus complexe que pour la décroissance, mais elle est le plus souvent intégrée directement dans les bibliothèques d'apprentissage profond telles que Keras.

Les calendriers basés sur le temps modifient le taux d'apprentissage en fonction du taux de l'itération précédente. En intégrant la décroissance, la formule mathématique du taux d'apprentissage est :

η_{n+1} = η₀ / (1 + d n)

où η est le taux d'apprentissage, η₀ est le taux d'apprentissage initial, d est un paramètre de décroissance, et n est le numéro de l'itération.

Les calendriers par paliers modifient le taux d'apprentissage selon des étapes prédéfinies. La formule d'application de la décroissance est définie comme :

η_n = η₀ d^(⌊(1+n)/r⌋)

où η_n est le taux d'apprentissage à l'itération n, η₀ est le taux d'apprentissage initial, d est le facteur de changement du taux à chaque palier (0,5 correspond à une division par deux), et r correspond au taux de palier, c'est-à-dire la fréquence à laquelle le taux est réduit (10 correspond à une réduction toutes les 10 itérations). La fonction plancher (⌊…⌋) arrondit la valeur de son argument à l'entier inférieur.

Les calendriers exponentiels sont similaires aux calendriers par paliers, mais au lieu de paliers, une fonction exponentielle décroissante est utilisée. La formule mathématique intégrant la décroissance est :

η_n = η₀ e^(−d n)

où d est un paramètre de décroissance.

Taux d'apprentissage adaptatif

Le problème des calendriers de taux d'apprentissage est qu'ils dépendent tous d'hyperparamètres qui doivent être choisis manuellement pour chaque problème d'apprentissage et qui peuvent varier considérablement selon la nature du problème ou le modèle utilisé. Pour pallier cela, il existe de nombreux algorithmes de descente de gradient adaptatifs, tels que Adagrad, Adadelta, RMSprop et Adam, qui sont généralement intégrés dans les bibliothèques d'apprentissage profond comme Keras.

Rôle dans l'apprentissage profond

Les calendriers de taux d'apprentissage sont un composant essentiel de l'entraînement des réseaux de neurones modernes, y compris les modèles d'apprentissage profond et les grands modèles de langage. En pratique, des frameworks comme TensorFlow et PyTorch fournissent des implémentations intégrées de calendriers. Par exemple, OpenAI et Anthropic utilisent des techniques de planification sophistiquées lors de l'entraînement de leurs modèles basés sur des transformeurs afin de garantir une convergence stable. De même, Google DeepMind et Meta AI emploient des calendriers personnalisés pour leurs campagnes d'entraînement à grande échelle.

Considérations pratiques

Le choix d'un calendrier de taux d'apprentissage approprié relève souvent de l'expérimentation. Les pratiques courantes incluent l'utilisation d'une phase d'échauffement, où le taux d'apprentissage augmente linéairement à partir d'une petite valeur, suivie d'une phase de décroissance. Cette approche contribue à stabiliser l'entraînement lors des premières itérations. De plus, certains calendriers comme l'échauffement cosinusoïdal et les taux d'apprentissage cycliques ont gagné en popularité en raison de leur capacité à échapper aux minima prononcés.

Voir aussi

  • apprentissage automatique
  • optimisation
  • descente de gradient
  • réglage des hyperparamètres
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·optimization·deep-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique