En statistiques et en apprentissage automatique, les méthodes d'ensemble combinent plusieurs algorithmes d'apprentissage pour obtenir de meilleures performances prédictives que celles d'un seul algorithme. Contrairement à un ensemble statistique en mécanique statistique, qui est souvent infini, un ensemble en apprentissage automatique consiste en un ensemble fini de modèles alternatifs, mais il permet des structures flexibles parmi ces alternatives. L'idée centrale est que des modèles faibles diversifiés, une fois agrégés, peuvent produire une prédiction plus précise et plus robuste.
L'apprentissage par ensemble est un concept fondamental du Machine learning et de l'Artificial intelligence, largement appliqué dans des domaines allant du Deep learning aux Large language model systems. En exploitant plusieurs modèles, les ensembles réduisent la variance, atténuent le biais et améliorent la généralisation, ce qui en fait une pierre angulaire de la modélisation prédictive moderne.
Vue d'ensemble
Les algorithmes d'apprentissage supervisé recherchent dans un espace d'hypothèses une hypothèse appropriée pour un problème particulier. Même si cet espace contient des hypothèses bien adaptées, il peut être difficile d'en trouver une. Les ensembles combinent plusieurs hypothèses pour en former une qui est théoriquement meilleure. L'apprentissage par ensemble entraîne deux ou plusieurs algorithmes sur une tâche de classification ou de régression spécifique. Les algorithmes au sein d'un ensemble sont appelés « modèles de base », « apprenants de base » ou « apprenants faibles ». Ces modèles de base peuvent être construits à l'aide d'un seul algorithme d'apprentissage ou de plusieurs algorithmes différents. L'objectif est d'entraîner un ensemble diversifié de modèles faibles sur la même tâche, de sorte que, bien que chaque apprenant faible pris individuellement présente un biais élevé et une variance élevée (ce qui le rend peu performant), la combinaison de ces modèles puisse produire un modèle unique à la fois plus performant, plus précis et à faible variance.
L'apprentissage par ensemble fait généralement référence aux techniques de bagging (agrégation par bootstrap), de boosting ou de stacking (empilement). Le bagging crée une diversité en générant des échantillons aléatoires à partir des données d'entraînement et en ajustant le même modèle à chaque échantillon, produisant ainsi des ensembles homogènes. Le boosting suit un processus itératif, entraînant séquentiellement chaque modèle de base sur les erreurs pondérées du modèle précédent, afin de produire un modèle additif réduisant l'erreur finale ; il s'agit d'ensembles séquentiels. Le stacking combine différents modèles de base, chacun entraîné indépendamment, puis utilise un méta-modèle pour combiner leurs prédictions, produisant ainsi des ensembles hétérogènes. Les applications courantes incluent les forêts aléatoires (une extension du bagging), les arbres boostés et les modèles d'arbre à gradient boosté. Le stacking est souvent utilisé pour des tâches spécifiques, en combinant des méthodes paramétriques et non paramétriques.
L'évaluation d'un ensemble nécessite généralement plus de calculs que celle d'un modèle unique. En ce sens, l'apprentissage par ensemble compense les faiblesses d'un algorithme d'apprentissage en effectuant des calculs supplémentaires. Alternativement, on pourrait utiliser un seul modèle non ensembliste, mais l'ensemble peut être plus efficace pour améliorer la précision globale, pour un même coût en calcul, en mémoire ou en communication, en répartissant ces ressources sur deux ou plusieurs méthodes plutôt que de les concentrer sur une seule. Les algorithmes rapides comme les arbres de décision sont couramment utilisés dans les méthodes d'ensemble (par exemple, les forêts aléatoires), mais les algorithmes plus lents peuvent également en bénéficier.
Par analogie, les techniques d'ensemble ont également été utilisées dans l'apprentissage non supervisé, comme le consensus clustering ou la détection d'anomalies.
Théorie des ensembles
Empiriquement, les ensembles ont tendance à donner de meilleurs résultats lorsque les modèles qui les composent sont suffisamment diversifiés. De nombreuses méthodes d'ensemble cherchent donc à favoriser cette diversité. De manière contre-intuitive, des algorithmes plus aléatoires (comme les arbres de décision aléatoires) peuvent produire un ensemble plus fort que des algorithmes très déterministes (comme les arbres de décision qui réduisent l'entropie). L'utilisation d'une variété d'algorithmes d'apprentissage forts s'est révélée plus efficace que des techniques qui affaiblissent délibérément les modèles pour accroître la diversité. La diversité peut être accrue lors de la phase d'entraînement, en utilisant des corrélations pour les tâches de régression ou des mesures d'information comme l'entropie croisée pour la classification.
Théoriquement, le concept de diversité est justifié car le taux d'erreur d'un ensemble peut être décomposé en trois termes : le biais, la variance et la diversité. Un bon ensemble doit donc équilibrer ces trois aspects.
Cadre géométrique
L'apprentissage par ensemble, qu'il s'agisse de régression ou de classification, peut être expliqué à l'aide d'un cadre géométrique. La sortie de chaque classifieur ou régresseur pour l'ensemble des données peut être vue comme un point dans un espace multidimensionnel. La cible recherchée est également un point, appelé « point idéal ». La distance euclidienne mesure à la fois la performance (distance au point idéal) et la dissimilarité entre les classifieurs (distance entre les points). Cela transforme le problème d'ensemble en un problème déterministe : on peut prouver que la moyenne des sorties de tous les classifieurs de base donne un résultat au moins aussi bon que la moyenne des performances individuelles. Avec une pondération optimale, la moyenne pondérée peut surpasser n'importe quel classifieur individuel de l'ensemble.
Taille de l'ensemble
Le nombre de classifieurs composant un ensemble a un impact important sur la précision prédictive. Cependant, peu d'études abordent la détermination a priori de cette taille. Avec l'essor des flux de données massifs et à grande vitesse, la taille des ensembles devient un enjeu crucial pour les classifieurs en ligne. Des tests statistiques ont été utilisés pour déterminer le nombre approprié de composants. Plus récemment, un cadre théorique a suggéré qu'il existe un nombre idéal de classifieurs indépendants, au-delà duquel la précision se dégrade : c'est ce qu'on appelle la « loi des rendements décroissants » dans la construction d'ensembles. Ce cadre montre qu'utiliser le même nombre de classifieurs indépendants que le nombre d'étiquettes de classe donne la meilleure précision.
Types courants d'ensembles
Classifieur optimal bayésien
Le classifieur optimal bayésien est un ensemble théorique qui moyenne toutes les hypothèses de l'espace des hypothèses, pondérées par leur probabilité a posteriori. Il représente le meilleur classifieur possible pour un problème donné, mais il est souvent impossible à calculer en pratique. Il sert de référence pour évaluer les autres méthodes d'ensemble.
Bagging
Le bagging, ou agrégation par bootstrap, a été introduit par Leo Breiman en 1994. Il consiste à générer plusieurs échantillons bootstrap (tirages avec remise) à partir des données d'entraînement, à ajuster un modèle sur chaque échantillon, puis à moyenner les prédictions pour la régression ou à voter pour la classification. Les forêts aléatoires en sont l'exemple le plus connu : elles combinent le bagging avec une sélection aléatoire de caractéristiques à chaque nœud de l'arbre. Le bagging réduit la variance et aide à éviter le sur-apprentissage.
Boosting
Le boosting est une technique d'ensemble séquentielle qui se concentre sur les instances difficiles à classer. Des algorithmes comme AdaBoost, introduit par Freund et Schapire en 1996, attribuent des poids aux exemples d'entraînement, augmentant les poids des instances mal classées à chaque itération. Chaque nouveau modèle est entraîné sur les données pondérées, et les prédictions sont combinées par vote pondéré. Le gradient boosting, avec des implémentations comme XGBoost et LightGBM, construit des modèles de manière incrémentale en optimisant une fonction de perte. Le boosting réduit le biais et peut produire des modèles très précis.
Stacking
Le stacking, ou généralisation empilée, consiste à entraîner plusieurs modèles de base diversifiés sur les données originales, puis à utiliser un méta-modèle (ou apprenant de niveau supérieur) pour combiner leurs prédictions. Les modèles de base peuvent être de natures très différentes, par exemple des Neural network et des arbres de décision. Le stacking donne souvent de meilleures performances qu'un modèle unique, car il exploite la complémentarité des modèles.
Vote et moyenne
Le vote (pour la classification) et la moyenne (pour la régression) sont des méthodes d'ensemble simples. Elles combinent les prédictions de plusieurs modèles, avec des poids égaux ou appris. Ces méthodes sont simples mais efficaces, surtout lorsque les modèles sont diversifiés.
Applications dans l'IA moderne
Les méthodes d'ensemble sont largement utilisées dans les systèmes d'IA modernes. Dans le Deep learning, des ensembles de réseaux de neurones sont utilisés pour améliorer la robustesse et la précision. Par exemple, les systèmes basés sur les Large language model utilisent souvent des ensembles de modèles pour générer des sorties plus fiables. Des entreprises comme OpenAI, Anthropic et Google DeepMind emploient des techniques d'ensemble dans leurs recherches et leurs produits. En vision par ordinateur, des ensembles de réseaux convolutifs ont remporté des compétitions comme ImageNet. En traitement du langage naturel, des ensembles de transformeurs améliorent les performances sur des tâches comme la traduction et l'analyse de sentiments.
Les méthodes d'ensemble sont également utilisées dans la détection d'anomalies, où la combinaison de plusieurs détecteurs réduit les faux positifs. Dans le diagnostic médical, des ensembles de classifieurs améliorent la précision. Dans la conduite autonome, des ensembles de modèles de perception renforcent la sécurité.
Défis et orientations futures
Malgré leurs avantages, les ensembles présentent des défis. Ils nécessitent davantage de ressources de calcul et de stockage. Leur interprétabilité est souvent inférieure à celle d'un modèle unique. Déterminer la taille et la diversité optimales d'un ensemble reste un problème ouvert. La recherche future se concentre sur des méthodes d'ensemble efficaces, comme la distillation de connaissances, où un modèle unique est entraîné pour imiter un ensemble, et la recherche d'architecture neuronale pour les composants d'ensemble. À mesure que l'IA évolue, les ensembles resteront une technique clé pour améliorer la performance et la fiabilité.
Conclusion
Les ensembles de modèles sont une technique puissante en apprentissage automatique, permettant de combiner plusieurs modèles pour obtenir de meilleures performances qu'un modèle unique. En exploitant la diversité, les ensembles réduisent l'erreur et améliorent la généralisation. Les méthodes courantes incluent le bagging, le boosting et le stacking, chacune avec ses forces spécifiques. Les ensembles sont essentiels dans les applications modernes de l'IA, de la Generative AI à la conduite autonome. À mesure que les ressources de calcul augmentent, les ensembles continueront de jouer un rôle vital dans le progrès de l'intelligence artificielle.