La mise à l'échelle des caractéristiques est une technique de prétraitement des données utilisée en apprentissage automatique pour normaliser la plage des variables indépendantes ou des caractéristiques des données. Dans de nombreux algorithmes, la présence de caractéristiques avec des échelles très différentes peut fausser le processus d'apprentissage, rendant les modèles biaisés en faveur des caractéristiques ayant des magnitudes plus grandes. La mise à l'échelle des caractéristiques répond à ce problème en transformant les données afin que toutes les caractéristiques contribuent proportionnellement à l'objectif du modèle.
La nécessité de la mise à l'échelle des caractéristiques découle du fait que de nombreux algorithmes d'apprentissage automatique, tels que ceux basés sur des calculs de distance ou la descente de gradient, sont sensibles à la magnitude des valeurs d'entrée. Par exemple, dans un ensemble de données avec des caractéristiques comme l'âge (allant de 0 à 100) et le revenu (allant de 0 à 100 000), la caractéristique du revenu dominerait les calculs basés sur la distance à moins d'être mise à l'échelle. La mise à l'échelle garantit qu'aucune caractéristique ne domine le processus d'apprentissage, ce qui conduit à une convergence plus rapide et à une meilleure précision du modèle.
Méthodes de mise à l'échelle des caractéristiques
Plusieurs techniques existent pour la mise à l'échelle des caractéristiques, chacune avec des propriétés et des cas d'utilisation distincts. Les méthodes les plus courantes incluent la normalisation min-max, la standardisation (normalisation z-score) et la mise à l'échelle robuste.
La normalisation min-max redimensionne les caractéristiques à une plage fixe, généralement [0, 1] ou [-1, 1]. La transformation est donnée par (x - min) / (max - min), où min et max sont les valeurs minimales et maximales de la caractéristique. Cette méthode est sensible aux valeurs aberrantes, car des valeurs extrêmes peuvent compresser la plage mise à l'échelle de la majorité des données.
La standardisation (ou normalisation z-score) transforme les caractéristiques pour avoir une moyenne de 0 et un écart type de 1, en utilisant la formule (x - moyenne) / écart type. Contrairement à la normalisation min-max, la standardisation ne borne pas les valeurs à une plage spécifique, et elle est moins affectée par les valeurs aberrantes car elle utilise la moyenne et l'écart type, qui sont plus robustes que le min et le max.
La mise à l'échelle robuste utilise la médiane et l'intervalle interquartile (IQR) pour mettre à l'échelle les caractéristiques, ce qui la rend très résiliente aux valeurs aberrantes. La formule est (x - médiane) / IQR. Cette méthode est particulièrement utile lorsque les données contiennent des valeurs aberrantes significatives qui pourraient fausser d'autres méthodes de mise à l'échelle.
D'autres méthodes incluent la mise à l'échelle max-abs, qui met à l'échelle chaque caractéristique par sa valeur absolue maximale, et la mise à l'échelle par vecteur unitaire, qui met à l'échelle chaque échantillon pour avoir une norme unitaire.
Importance dans les algorithmes d'apprentissage automatique
La mise à l'échelle des caractéristiques est essentielle pour les algorithmes qui reposent sur des métriques de distance, tels que les k-plus proches voisins, les machines à vecteurs de support et les algorithmes de clustering comme k-means. Dans ces algorithmes, la distance euclidienne entre les points de données est calculée, et les caractéristiques avec des échelles plus grandes influenceraient de manière disproportionnée le calcul de la distance.
Les algorithmes basés sur la descente de gradient, y compris l'entraînement des réseaux de neurones, bénéficient également de la mise à l'échelle des caractéristiques. Lorsque les caractéristiques ont des échelles différentes, le chemin de la descente de gradient peut devenir allongé et oscillatoire, conduisant à une convergence lente. La mise à l'échelle des caractéristiques aide à créer une surface d'erreur plus sphérique, permettant à la descente de gradient de converger plus rapidement et de manière plus fiable.
Les modèles basés sur les arbres, tels que les arbres de décision et les forêts aléatoires, sont généralement invariants à la mise à l'échelle des caractéristiques car ils effectuent des divisions basées sur les valeurs des caractéristiques plutôt que sur les distances. Cependant, la mise à l'échelle peut encore être bénéfique dans certaines implémentations, comme lors de l'utilisation de la régularisation ou lors de la combinaison de modèles basés sur les arbres avec d'autres composants.
Applications en apprentissage profond
En apprentissage profond, la mise à l'échelle des caractéristiques est souvent appliquée dans le cadre des pipelines de prétraitement des données. Par exemple, dans le traitement d'images, les valeurs des pixels sont couramment mises à l'échelle de la plage [0, 255] à [0, 1] ou standardisées pour avoir une moyenne nulle et une variance unitaire. Cette pratique aide à stabiliser l'entraînement et améliore l'efficacité de techniques comme la normalisation par lots et la normalisation de couche, qui sont elles-mêmes des formes de mise à l'échelle des caractéristiques appliquées au sein du réseau.
Pour l'entraînement des grands modèles de langage, la mise à l'échelle des caractéristiques est moins souvent discutée car les données textuelles sont généralement tokenisées et plongées dans un espace vectoriel, mais la mise à l'échelle joue toujours un rôle dans l'initialisation et la normalisation des vecteurs d'incorporation. Des techniques comme l'initialisation des poids et les couches de normalisation sont conçues pour maintenir des échelles appropriées tout au long du réseau, empêchant des problèmes tels que les gradients qui disparaissent ou explosent.
Considérations pratiques
Lors de l'application de la mise à l'échelle des caractéristiques, il est essentiel d'ajuster les paramètres de mise à l'échelle (par exemple, min, max, moyenne, écart type) uniquement sur l'ensemble d'entraînement, puis d'appliquer la même transformation aux ensembles de validation et de test. Cela évite la fuite de données, où des informations de l'ensemble de test influencent le processus d'entraînement, conduisant à des estimations de performance trop optimistes.
Le choix de la méthode de mise à l'échelle dépend de la distribution des données et de l'algorithme utilisé. Pour les données avec des valeurs aberrantes, la mise à l'échelle robuste ou la standardisation est souvent préférée à la normalisation min-max. Pour les données approximativement gaussiennes, la standardisation est un choix par défaut courant. Pour les données bornées, comme les intensités de pixels, la normalisation min-max est fréquemment utilisée.
La mise à l'échelle des caractéristiques est également liée à d'autres techniques de prétraitement telles que le clipping de gradient, qui aborde des problèmes de stabilité similaires pendant l'entraînement, et l'apprentissage par curriculum, qui peut impliquer la mise à l'échelle de la difficulté des exemples d'entraînement. En pratique, la mise à l'échelle des caractéristiques est une étape fondamentale dans le pipeline d'apprentissage automatique, et son application correcte peut avoir un impact significatif sur les performances du modèle.