La méthode de groupement des données (GMDH) est une approche de modélisation inductive qui construit automatiquement des modèles polynomiaux à partir de données. Elle a été développée par Alexey Ivakhnenko en Union soviétique en 1968 comme un moyen de modéliser des systèmes complexes sans nécessiter de connaissances préalables sur les processus physiques sous-jacents. La GMDH est souvent décrite comme une méthode auto-organisatrice car elle construit itérativement des modèles en sélectionnant les variables d'entrée les plus pertinentes et en les combinant à travers des fonctions polynomiales simples, généralement quadratiques, afin de minimiser l'erreur de prédiction sur les données de validation.
La GMDH appartient à la famille plus large des techniques de apprentissage automatique et est considérée comme une forme précoce de apprentissage profond en raison de sa structure en couches et à propagation avant. Contrairement aux réseaux de neurones conventionnels qui reposent sur la rétropropagation et l'optimisation par gradient, la GMDH utilise un processus de sélection heuristique basé sur des critères externes, tels que le critère de régularité, pour déterminer quels nœuds conserver à chaque couche. Cela la rend particulièrement efficace pour les problèmes à petits échantillons et pour modéliser des relations non linéaires dans des environnements bruités.
Développement historique
La méthode a été introduite par Alexey Ivakhnenko en 1968, s'appuyant sur des travaux antérieurs en cybernétique et en systèmes auto-organisateurs. Les recherches d'Ivakhnenko à l'Institut de cybernétique de Kyiv, en Ukraine, visaient à créer des modèles capables de découvrir automatiquement la structure de systèmes complexes à partir de données, sans intervention humaine. L'approche a gagné en popularité dans les années 1970 et 1980, en particulier en Union soviétique et en Europe de l'Est, pour des applications en économie, en écologie et en ingénierie.
La GMDH a été l'une des premières méthodes à utiliser une architecture en couches similaire aux modèles modernes de apprentissage profond, mais elle différait en ce qu'elle ne reposait pas sur la descente de gradient. Au lieu de cela, elle utilisait un processus de sélection combinatoire, ce qui la rendait intensive en calcul mais aussi robuste contre le surajustement lorsqu'elle était correctement régularisée. La méthode a influencé les développements ultérieurs dans les réseaux de neurones et la régression symbolique, bien qu'elle soit restée relativement obscure en Occident jusqu'aux années 1990.
Algorithme et architecture
L'algorithme GMDH fonctionne de manière couche par couche. À chaque couche, il génère des modèles candidats en appariant les variables d'entrée (ou les sorties de la couche précédente) et en ajustant un polynôme, généralement quadratique, de la forme : y = a + bx_i + cx_j + dx_i^2 + ex_j^2 + fx_ix_j. Les coefficients sont estimés en utilisant les moindres carrés sur un sous-ensemble d'entraînement des données.
Après avoir généré tous les modèles candidats possibles pour une couche, l'algorithme évalue chaque candidat sur un sous-ensemble de validation en utilisant un critère externe, tel que l'erreur quadratique moyenne ou le critère de régularité. Seuls les candidats les plus performants sont conservés et transmis à la couche suivante. Ce processus se poursuit jusqu'à ce que l'erreur de validation cesse de diminuer, moment auquel l'algorithme sélectionne le meilleur modèle de la couche finale. Le résultat est un réseau polynomial qui peut être exprimé sous forme d'un ensemble d'équations, ce qui le rend interprétable par rapport à de nombreux modèles de apprentissage automatique de type boîte noire.
L'architecture est similaire à un réseau de neurones à propagation avant, mais avec une différence clé : la structure n'est pas fixée à l'avance ; elle est déterminée par les données. Cette propriété auto-organisatrice est la marque de fabrique de la GMDH et la distingue des méthodes traditionnelles d'entraînement des réseaux de neurones.
Applications et cas d'utilisation
La GMDH a été appliquée dans un large éventail de domaines. En ingénierie, elle a été utilisée pour l'identification de processus, la détection de défauts et la conception de systèmes de contrôle. En économie et en finance, elle a été employée pour prévoir les cours des actions, les taux de change et les indicateurs macroéconomiques. En science environnementale, les modèles GMDH ont été utilisés pour prédire la qualité de l'air, la qualité de l'eau et les schémas météorologiques.
Une application notable se trouve dans le domaine de l'intelligence artificielle et du apprentissage automatique pour la prédiction de séries temporelles. La capacité de la GMDH à sélectionner automatiquement les variables retardées pertinentes la rend adaptée à la modélisation de systèmes dynamiques. Elle a également été utilisée en bioinformatique pour l'analyse de l'expression génique et en médecine pour le soutien au diagnostic.
Malgré l'essor de méthodes plus puissantes comme le apprentissage profond et les grands modèles de langage, la GMDH reste utile dans des scénarios où les données sont rares, où l'interprétabilité est importante, ou où le système sous-jacent est non linéaire et mal compris. Sa forme polynomiale permet une intégration facile avec des algorithmes d'optimisation et de contrôle.
Comparaison avec d'autres méthodes
La GMDH est souvent comparée aux réseaux de neurones, en particulier en termes d'entraînement et d'interprétabilité. Alors que les réseaux de neurones utilisent la rétropropagation et la descente de gradient, la GMDH utilise une recherche heuristique sur des combinaisons polynomiales. Cela rend la GMDH moins sujette aux minima locaux mais plus sensible au choix des critères externes et à la partition des données en ensembles d'entraînement et de validation.
Comparée aux méthodes de apprentissage profond, la GMDH nécessite généralement moins de paramètres et moins de ressources de calcul, mais elle peut ne pas bien passer à l'échelle pour des problèmes très dimensionnels. Elle est également moins flexible en termes de types de fonctions qu'elle peut représenter, car elle est limitée aux combinaisons polynomiales. Cependant, sa transparence et sa capacité à travailler avec de petits ensembles de données en font un outil précieux dans de nombreuses applications pratiques.
La GMDH est liée à d'autres techniques de modélisation inductive telles que la régression symbolique et la programmation génétique, mais elle diffère par son processus de sélection déterministe et par couches. Elle partage également des similitudes conceptuelles avec les réseaux résiduels en ce que chaque couche affine la prédiction, mais le mécanisme de sélection est distinct.
Limites et extensions
L'une des principales limites de la GMDH est sa complexité de calcul, en particulier lorsque le nombre de variables d'entrée est important, car le nombre de paires candidates croît de manière quadratique. De plus, la méthode peut surajuster si le critère externe n'est pas correctement choisi ou si l'ensemble de validation n'est pas représentatif. Diverses extensions ont été proposées pour résoudre ces problèmes, notamment l'utilisation de différents degrés polynomiaux, des techniques de régularisation et des approches hybrides qui combinent la GMDH avec d'autres méthodes de apprentissage automatique.
Une autre limite est que la GMDH suppose que la relation entre les entrées et les sorties peut être approximée par des polynômes, ce qui peut ne pas tenir pour tous les systèmes. Dans de tels cas, d'autres méthodes comme le apprentissage profond ou les modèles basés sur Transformer (architecture) peuvent être plus appropriées. Néanmoins, la GMDH reste une contribution importante, tant historique que pratique, au domaine de l'intelligence artificielle.