Ingénierie des caractéristiques

Traduit de l'anglais

L'ingénierie des caractéristiques est l'étape de prétraitement qui consiste à sélectionner, transformer et extraire des données brutes en caractéristiques afin d'améliorer les performances des modèles d'apprentissage automatique. Elle est appliquée dans divers domaines, y compris la physique, et est essentielle pour la précision prédictive.

L'ingénierie des caractéristiques est une étape de prétraitement dans l'apprentissage supervisé et la modélisation statistique qui transforme les données brutes en un ensemble d'entrées plus efficace. Chaque entrée comprend plusieurs attributs, appelés caractéristiques. En fournissant aux modèles des informations pertinentes, l'ingénierie des caractéristiques améliore considérablement leur précision prédictive et leur capacité de prise de décision. Les principes s'étendent au-delà de l'apprentissage automatique à des domaines scientifiques comme la physique, où des nombres sans dimension tels que le nombre de Reynolds en dynamique des fluides, le nombre de Nusselt en transfert de chaleur et le nombre d'Archimède en sédimentation sont construits, et où des solutions analytiques pour la résistance des matériaux sont développées comme premières approximations.

Applications de regroupement

L'ingénierie des caractéristiques est largement utilisée pour regrouper les caractéristiques-objets ou les échantillons-objets dans les ensembles de données. Les méthodes basées sur la décomposition matricielle, en particulier celles avec des contraintes de non-négativité sur les coefficients des caractéristiques, sont largement appliquées. Cela inclut la factorisation en matrices non négatives (NMF), la factorisation en matrices tri non négatives (NMTF) et la décomposition/factorisation tensorielle non négative (NTF/NTD). Les contraintes de non-négativité produisent des représentations basées sur les parties, et différentes matrices de facteurs présentent des propriétés de regroupement naturelles. Les extensions incluent la factorisation avec contraintes d'orthogonalité pour le regroupement dur et l'apprentissage de variétés pour résoudre les problèmes inhérents à l'algorithme.

D'autres approches exploitent des structures cachées communes à travers plusieurs ensembles de données interdépendants pour obtenir un regroupement par consensus. La classification multi-vues basée sur la décomposition matricielle par consensus (MCMD) extrait un schéma de regroupement commun à travers les ensembles de données, produit des étiquettes de classe invariantes et variant selon l'échelle, est robuste aux informations manquantes, peut détecter les valeurs aberrantes basées sur la forme et l'échelle, et gère efficacement les données de haute dimension. Les décompositions couplées de matrices et de tenseurs sont populaires dans l'ingénierie des caractéristiques multi-vues.

Modélisation prédictive

Dans l'apprentissage automatique et la modélisation statistique, l'ingénierie des caractéristiques implique la sélection, la création, la transformation et l'extraction de caractéristiques. Les composants clés incluent la création de caractéristiques à partir de données existantes, la transformation et l'imputation de caractéristiques manquantes ou invalides, la réduction de dimensionnalité via des méthodes comme l'analyse en composantes principales (PCA), l'analyse en composantes indépendantes (ICA) et l'analyse discriminante linéaire (LDA), et la sélection de caractéristiques pertinentes basées sur des scores d'importance et des matrices de corrélation.

Les caractéristiques varient en importance ; même des caractéristiques relativement insignifiantes peuvent contribuer à un modèle. La sélection de caractéristiques peut réduire le nombre de caractéristiques pour éviter le surapprentissage. L'explosion des caractéristiques se produit lorsque le nombre de caractéristiques identifiées est trop important pour une estimation efficace du modèle, souvent causée par des modèles de caractéristiques ou des combinaisons de caractéristiques qui ne peuvent pas être représentées par un système linéaire. Elle peut être limitée via la régularisation, les méthodes à noyau et la sélection de caractéristiques.

Modèles de caractéristiques

Les modèles de caractéristiques sont des spécifications abstraites de caractéristiques utilisées pour peupler automatiquement l'ensemble de caractéristiques à partir de chaque instance de l'ensemble d'entraînement et de test. Ils permettent la génération automatique de grands nombres de caractéristiques spécifiques, réduisant l'effort de codage manuel.

Automatisation

L'automatisation de l'ingénierie des caractéristiques est un sujet de recherche depuis les années 1990, avec des logiciels commerciaux d'apprentissage automatique l'intégrant depuis 2016. La littérature académique se divise en deux types principaux : l'apprentissage d'arbres de décision multi-relationnels (MRDTL) et la synthèse profonde de caractéristiques.

Apprentissage d'arbres de décision multi-relationnels (MRDTL)

MRDTL étend les méthodes traditionnelles d'arbres de décision aux bases de données relationnelles, gérant des relations de données complexes à travers les tables. Il utilise des graphes de sélection comme nœuds de décision, affinés systématiquement jusqu'à ce qu'un critère de terminaison soit atteint. La plupart des implémentations sont basées sur des bases de données relationnelles, entraînant des opérations redondantes qui peuvent être réduites en utilisant des techniques comme la propagation d'identifiants de tuples.

Implémentations open-source

Plusieurs bibliothèques open-source automatisent l'ingénierie des caractéristiques sur des données relationnelles et des séries temporelles :

  • featuretools : Bibliothèque Python pour transformer des séries temporelles et des données relationnelles en matrices de caractéristiques.
  • MCMD : Algorithme open-source pour le regroupement conjoint de plusieurs ensembles de données.
  • OneBM (One-Button Machine) : Combine les transformations et la sélection de caractéristiques sur des données relationnelles, réduisant le temps d'exploration des données.
  • getML community : Outil C/C++ avec interface Python, au moins 60 fois plus rapide que tsflex, tsfresh, tsfel, featuretools ou kats.
  • tsfresh : Bibliothèque Python pour l'extraction de caractéristiques de séries temporelles, évaluant la qualité des caractéristiques via des tests d'hypothèses.
  • tsflex : Bibliothèque Python pour les caractéristiques de séries temporelles, plus rapide et plus efficace en mémoire que tsfresh, seglearn ou tsfel.
  • seglearn : Extension pour les données de séries temporelles multivariées et séquentielles à scikit-learn.
  • tsfel : Paquet Python pour l'extraction de caractéristiques de séries temporelles.
  • kats : Boîte à outils Python pour l'analyse de séries temporelles.

Synthèse profonde de caractéristiques

L'algorithme de synthèse profonde de caractéristiques (DFS) a battu 615 des 906 équipes humaines dans une compétition, démontrant son efficacité.

Magasins de caractéristiques

Un magasin de caractéristiques est un référentiel central où les caractéristiques sont stockées et organisées dans le but explicite d'entraîner des modèles ou de faire des prédictions. Il permet aux scientifiques des données de créer ou de mettre à jour des groupes de caractéristiques, assurant la cohérence et la réutilisabilité à travers différents modèles et applications.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:feature-engineering·machine-learning·data-preprocessing·data-science
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique