La sélection d'instances, également connue sous le nom de réduction de jeu de données ou condensation de jeu de données, est une étape de prétraitement des données appliquée dans de nombreuses tâches de apprentissage automatique et d'exploration de données. Son objectif principal est de réduire le jeu de données original à un volume gérable, diminuant ainsi les ressources computationnelles nécessaires au processus d'apprentissage. De plus, les algorithmes de sélection d'instances peuvent éliminer les instances bruitées avant l'apprentissage, ce qui peut améliorer la précision dans les problèmes de classification. Le résultat optimal est le sous-ensemble de données minimal qui atteint la même tâche sans perte de performance par rapport à l'utilisation de l'ensemble du jeu de données, nécessitant un compromis entre le taux de réduction et la qualité de classification.
Catégories d'algorithmes
Les algorithmes de sélection d'instances sont regroupés par le type d'instances qu'ils préservent. Une classe se concentre sur les instances de frontière, qui se trouvent près des frontières de décision des classes. Les algorithmes de ce groupe incluent DROP3, ICF et LSBo. Une autre classe préserve les instances internes, qui sont centrales pour chaque classe ; des exemples incluent ENN et LSSm. Ces algorithmes de sélection interne sont souvent utilisés pour filtrer les instances nuisibles ou bruitées, et ils peuvent servir d'étapes de prétraitement pour les méthodes de sélection de frontière. Par exemple, ENN est la première étape de DROP3, et LSSm est utilisé par LSBo.
Une troisième catégorie sélectionne les instances les plus denses dans des voisinages arbitraires, pouvant inclure à la fois des points de frontière et internes. Des algorithmes tels que LDIS, CDIS et XLDIS appartiennent à cette catégorie. LDIS et CDIS sont simples et produisent des sous-ensembles hautement représentatifs des données originales. Parce qu'ils recherchent des instances représentatives séparément dans chaque classe, ils sont plus rapides en complexité temporelle et en temps d'exécution effectif que des algorithmes comme DROP3 et ICF.
Approches basées sur des prototypes
Certains algorithmes ne sélectionnent pas des instances réelles mais génèrent plutôt des prototypes synthétiques. PSSA, PSDSP et PSSP utilisent la notion de partition spatiale, spécifiquement des hyperrectangles, pour identifier des instances similaires et extraire un prototype pour chaque groupe. Ces approches peuvent être adaptées pour sélectionner également des instances réelles ; l'algorithme ISDSP suit une stratégie similaire mais choisit des instances réelles plutôt que des prototypes.
Applications et compromis
La sélection d'instances est précieuse dans des scénarios avec de grands jeux de données où le temps d'entraînement et l'utilisation de la mémoire sont des préoccupations significatives. En réduisant le jeu de données, elle permet un entraînement plus rapide du modèle et peut améliorer la généralisation en éliminant le bruit. Cependant, une réduction agressive risque de perdre des instances informatives, ce qui peut dégrader la performance de classification. L'équilibre entre le taux de réduction et la précision est central pour évaluer toute stratégie de sélection d'instances.
Relation avec d'autres techniques
La sélection d'instances est distincte de la augmentation de données, qui génère de nouveaux échantillons synthétiques pour étendre le jeu de données, et de la élagage de modèle, qui réduit la complexité du modèle après l'entraînement. Elle est également différente de la sélection de caractéristiques, qui réduit le nombre d'attributs plutôt que d'instances. En pratique, la sélection d'instances est souvent combinée avec d'autres étapes de prétraitement pour optimiser le pipeline global d'apprentissage automatique.
Évaluation et considérations pratiques
Les métriques d'évaluation courantes incluent le taux de réduction, qui mesure la proportion d'instances supprimées, et la précision de classification sur un ensemble de test réservé. Le choix de l'algorithme dépend de la distribution des données et des objectifs spécifiques, tels que l'élimination du bruit par rapport à la réduction maximale. Des algorithmes comme ENN sont efficaces pour nettoyer les jeux de données bruités, tandis que des méthodes basées sur la frontière comme DROP3 visent à conserver les frontières de décision critiques. Le coût computationnel du processus de sélection lui-même est également un facteur, avec des méthodes plus simples comme LDIS étant préférées pour les très grands jeux de données.
Directions futures
La recherche continue d'explorer des méthodes de sélection d'instances plus efficaces et évolutives, en particulier pour les données à haute dimension et les applications de apprentissage profond. Il y a un intérêt à intégrer la sélection d'instances avec les pipelines d'entraînement des réseaux de neurones, où la réduction du jeu de données peut accélérer l'entraînement sans perte significative de précision. Alors que les jeux de données croissent en taille et en complexité, la sélection d'instances reste un outil pertinent pour gérer les ressources computationnelles dans les systèmes d'intelligence artificielle.