Augmentation des données

Traduit de l'anglais

L'augmentation de données est une technique statistique et d'apprentissage automatique qui génère des copies modifiées de données existantes pour améliorer la généralisation des modèles et réduire le sur-apprentissage, largement appliquée dans la classification d'images et le traitement du signal.

L'augmentation de données est une technique statistique qui génère de nouveaux échantillons d'entraînement en appliquant des transformations ou des perturbations aux données existantes. En apprentissage automatique, elle est largement utilisée pour réduire le surapprentissage et améliorer la généralisation en entraînant des modèles sur plusieurs copies légèrement modifiées du jeu de données original. Cette approche est particulièrement précieuse lorsque les données sont rares ou déséquilibrées, car elle peut simuler un jeu de données plus vaste et plus diversifié, et renforcer la robustesse du modèle.

Dans sa forme statistique générale, l'augmentation de données permet l'estimation du maximum de vraisemblance à partir de données incomplètes en introduisant des variables latentes ou des composantes de données manquantes, une méthode ayant des applications importantes en analyse bayésienne. Dans le contexte de apprentissage automatique, la technique est devenue une pratique standard dans divers domaines, de la classification d'images au traitement du signal, en raison de sa capacité à améliorer les performances du modèle sans collecter de données réelles supplémentaires.

Contexte historique et premières utilisations

Les racines de l'augmentation de données en apprentissage automatique remontent au milieu des années 1990, lorsque les réseaux de neurones convolutifs (CNN) ont commencé à devenir plus grands. À cette époque, il y avait un manque de données suffisantes pour entraîner efficacement ces réseaux, surtout qu'une partie du jeu de données devait être réservée aux tests. Les chercheurs ont proposé de perturber les données existantes avec des transformations affines - telles que des rotations, des translations et des mises à l'échelle - pour créer de nouveaux exemples partageant les mêmes étiquettes que l'original. Cette approche a été complétée en 2003 par des distorsions élastiques, qui ont introduit des variations plus subtiles et plus réalistes. Dans les années 2010, l'augmentation de données a été largement adoptée pour l'entraînement des CNN, améliorant leurs performances et servant de contre-mesure contre les attaques adversariales, comme le profilage.

Suréchantillonnage synthétique pour données déséquilibrées

En apprentissage automatique traditionnel, un défi courant est celui des jeux de données déséquilibrés, où une classe a nettement moins d'échantillons qu'une autre. Par exemple, considérons un jeu de données de diagnostic médical avec 90 échantillons représentant des individus sains et seulement 10 échantillons représentant des individus atteints d'une maladie spécifique. Dans de tels cas, les algorithmes échouent souvent à classer la classe minoritaire en raison d'un biais vers la classe majoritaire.

La technique de suréchantillonnage synthétique des classes minoritaires (SMOTE) résout ce problème en générant des échantillons synthétiques pour la classe minoritaire. SMOTE fonctionne en sélectionnant aléatoirement un échantillon de la classe minoritaire, en trouvant ses voisins les plus proches, et en créant de nouveaux échantillons le long des segments de ligne qui relient ces voisins. Par exemple, s'il y a 100 échantillons dans la classe majoritaire et 10 dans la classe minoritaire, SMOTE peut produire des échantillons minoritaires synthétiques qui augmentent la minorité à, disons, 100 échantillons, équilibrant ainsi le jeu de données. Cette technique, apparue au début des années 2000, améliore ainsi les performances du modèle et constitue une pierre angulaire de l'augmentation de données pour les données tabulaires.

Techniques pour l'image

La classification d'images a été l'un des principaux bénéficiaires de l'augmentation de données, surtout avec l'essor du apprentissage profond. La pratique a évolué pour inclure une large gamme de transformations, enrichissant les données d'entraînement pour aider les modèles à mieux généraliser. Les catégories courantes incluent les transformations géométriques, les ajustements d'espace colorimétrique et l'injection de bruit.

Transformations géométriques

Les transformations géométriques modifient les propriétés spatiales des images, simulant différentes perspectives, orientations et échelles. Les techniques incluent :

  • Transformation affine (qui combine rotation, réflexion, translation et mise à l'échelle)
  • Rotation : rotation des images d'un degré spécifié pour aider les modèles à reconnaître les objets sous différents angles.
  • Réflexion : réflexion des images horizontalement ou verticalement pour introduire une variabilité d'orientation.
  • Translation : déplacement des images dans différentes directions pour enseigner l'invariance positionnelle aux modèles.
  • Mise à l'échelle : ajustement de la taille des objets dans l'image.
  • Cisaillement : inclinaison des images pour imiter différents angles de vue.
  • Recadrage : suppression de sections de l'image pour se concentrer sur des caractéristiques particulières ou simuler des vues plus rapprochées.
  • Distorsion élastique : déformation de l'image de manière non linéaire, proposée en 2003 et efficace dans des tâches comme la reconnaissance de l'écriture manuscrite.
  • Morphing au sein de la même classe : génération de nouveaux échantillons en appliquant des techniques de morphing entre deux images appartenant à la même classe, augmentant ainsi la diversité intra-classe.

Transformations de l'espace colorimétrique

Les transformations de l'espace colorimétrique modifient les propriétés de couleur des images, traitant les variations de luminosité, de saturation et de contraste. Elles incluent :

  • Ajustement de la luminosité : variation de la luminosité de l'image pour simuler différentes conditions d'éclairage.
  • Ajustement du contraste : modification du contraste pour aider à différents niveaux de clarté.
  • Ajustement de la saturation : modification de la saturation pour préparer les modèles à des images avec des intensités de couleur diverses.
  • Vibrations de couleur : ajustement aléatoire de la luminosité, du contraste, de la saturation et de la teinte pour introduire une variabilité de couleur, une norme pour améliorer la robustesse des CNN.

Injection de bruit

L'injection de bruit dans les images simule des imperfections du monde réel, apprenant aux modèles à ignorer les variations non pertinentes. Les techniques courantes incluent :

  • Bruit gaussien : ajout de bruit gaussien pour imiter le bruit du capteur ou le grain.
  • Bruit sel et poivre : introduction de pixels noirs ou blancs aléatoires pour simuler la poussière du capteur ou les pixels morts.

Ces méthodes ont été fondamentales pour rendre les classificateurs robustes aux distorsions du monde réel et sont largement utilisées depuis les années 1990.

Augmentation de données pour le traitement du signal

L'augmentation de données s'applique également aux séries temporelles et au traitement du signal. Pour les séries temporelles, les méthodes de bootstrap résiduel ou par blocs peuvent être utilisées pour générer des séquences augmentées, ce qui aide à améliorer la robustesse des modèles opérant sur des données temporelles.

Signaux biologiques

Dans le domaine des signaux biologiques, l'augmentation de données est d'une importance capitale en raison de la haute dimensionnalité et de la rareté de ces données. Les applications en contrôle robotique, et chez les sujets handicapés comme valides, reposent souvent sur des analyses spécifiques au sujet en raison du nombre limité d'échantillons. Cependant, la génération de données synthétiques peut considérablement étendre ces jeux de données.

Les chercheurs ont noté la difficulté de trouver des signaux tels que l'électromyographie (EMG) pour la maladie de Parkinson. Zanini et al. ont démontré l'utilisation d'un réseau antagoniste génératif (en particulier, un GAN convolutif profond) pour effectuer un transfert de style, générant des signaux EMG synthétiques correspondant à ceux des personnes atteintes de Parkinson. Cette approche montre comment les techniques de IA générative peuvent soutenir l'augmentation de données.

De même, dans les données d'électroencéphalographie (EEG), Wang et al. ont exploré l'utilisation de réseaux de neurones convolutifs profonds pour la reconnaissance des émotions basée sur l'EEG, et les résultats ont montré que la précision de la reconnaissance des émotions s'améliorait lorsque l'augmentation de données était appliquée.

Une méthode courante pour la génération de signaux synthétiques consiste à réorganiser des composantes de données réelles. Lotte a proposé une méthode appelée « Génération d'essais artificiels basée sur l'analogie », où trois exemples de données x₁, x₂ et x₃ fournissent une base ; par analogie, un échantillon synthétique artificiel x_synthétique est construit. Pour ce faire, une transformation qui modifie x₁ pour le rendre plus similaire à x₂ est définie, puis cette transformation est appliquée à x₃, générant ainsi l'échantillon synthétique. Cette approche a été utilisée dans des applications d'interface cerveau-ordinateur, où la rareté des données est sévère.

Les années 2010 ont vu l'essor de l'apprentissage profond, qui a amplifié le besoin d'augmentation de données, car les réseaux de neurones sont gourmands en données. Des techniques telles que SMOTE et les méthodes basées sur les GAN ont été intégrées aux boîtes à outils pour traiter les déséquilibres et la rareté dans des domaines spécialisés comme l'imagerie médicale et les signaux biologiques.

Relation avec d'autres méthodes

L'augmentation de données est souvent comparée à d'autres formes de régularisation, comme l'abandon (dropout) ou la décroissance du poids, mais elle est distincte en ce qu'elle modifie les données plutôt que le modèle. C'est un composant clé du succès des modèles d'apprentissage profond en vision par ordinateur (par exemple, sur ImageNet), en traitement du langage naturel et en reconnaissance vocale.

Dans le domaine des transformeurs, l'augmentation de données est généralement moins courante car ces modèles sont entraînés sur des corpus massifs, mais elle a encore des applications, par exemple, dans le réglage fin et l'apprentissage en quelques exemples.

Ces dernières années, les modèles génératifs eux-mêmes ont été utilisés comme augmentateurs de données, comme l'utilisation de réseaux antagonistes génératifs pour produire des images réalistes, mais les techniques originales et légères restent populaires en raison de leur faible coût computationnel.

Limites et considérations

Bien que l'augmentation de données soit efficace, les transformations doivent être choisies pour préserver l'étiquette. Par exemple, un retournement horizontal d'un chiffre manuscrit peut transformer un « 6 » en « 9 », ce qui pourrait induire le modèle en erreur. Ainsi, une augmentation spécifique au domaine est cruciale. Différents jeux de données nécessitent souvent des stratégies d'augmentation différentes, et une augmentation inappropriée peut réduire la précision du modèle.

En classification d'images, la ligne de recherche s'est également étendue des transformations artisanales aux politiques d'augmentation apprises, comme celles trouvées dans AutoAugment, développé chez Google en 2019 pour rechercher des stratégies d'augmentation optimales.

De plus, à travers les domaines, l'augmentation de données doit toujours être validée sur un ensemble de test réservé, car les données synthétiques peuvent introduire des biais irréalistes. Néanmoins, la technique est devenue un outil fondamental dans l'arsenal du praticien de l'apprentissage automatique.

Compte tenu de l'utilisation extensive dans un large éventail de domaines, de l'imagerie médicale à la conduite autonome, l'augmentation de données est fondamentale dans l'IA moderne. Son adoption par les principaux fournisseurs de services cloud, tels que Amazon Web Services, Azure et Google Cloud, a permis d'intégrer des algorithmes standard dans leurs pipelines d'apprentissage automatique automatisés, permettant aux utilisateurs de bénéficier de ces techniques sans écrire de code personnalisé.

L'efficacité de la technique pour réduire le surapprentissage la rend essentielle pour les modèles entraînés sur des jeux de données limités, et elle continue d'être un domaine de recherche dynamique, avec des avancées dans les modèles génératifs offrant de nouvelles possibilités pour créer des données synthétiques imitant étroitement les distributions réelles.

En résumé, l'augmentation de données est une méthode polyvalente et puissante qui traite la rareté des données, le déséquilibre et le surapprentissage, avec des applications allant de la vision par ordinateur au traitement du langage naturel.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:data-augmentation·machine-learning·statistical-technique·deep-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique