Traduit de l'anglais

L'agrégation bootstrap (bagging) est un méta-algorithme d'ensemble en apprentissage automatique qui améliore la stabilité et la précision en entraînant plusieurs modèles sur des échantillons bootstrap et en combinant leurs prédictions.

L'agrégation par amorçage, communément appelée bagging, est un meta-algorithme d'ensemble dans apprentissage automatique conçu pour améliorer la stabilité et la précision des algorithmes de classification et de régression. Elle réduit la variance et contribue à atténuer le sur-apprentissage. Bien que le bagging soit fréquemment appliqué aux méthodes d'arbres de décision, il peut être utilisé avec tout type de modèle. Il s'agit d'un cas particulier de l'approche plus large de moyenne d'ensemble, où plusieurs modèles sont combinés pour produire une prédiction unique.

Cette méthode a été introduite par Thomas Dietterich dans les années 1990, bien que le terme « bagging » ait été inventé par Michael Jordan dans un article de 1994. Depuis, le bagging est devenu un outil fondamental de l'apprentissage automatique, notamment dans le développement des forêts aléatoires et d'autres méthodes d'ensemble.

Idée Principale

L'idée principale derrière le bagging est d'exploiter la puissance de la moyenne. Les modèles individuels entraînés sur des sous-ensembles légèrement différents des données d'entraînement tendent à avoir des erreurs non corrélées. En faisant la moyenne de leurs prédictions, ces erreurs s'annulent, ce qui conduit à un modèle final plus robuste et plus précis. Cela est particulièrement bénéfique pour les algorithmes instables, où de petits changements dans les données d'entraînement peuvent entraîner de grands changements dans le modèle appris.

L'Algorithme de Bagging

Étant donné un ensemble d'entraînement standard \( D \) de taille \( n \), le bagging génère \( m \) nouveaux ensembles d'entraînement \( D_i \), chacun de taille \( n' \), en échantillonnant \( D \) uniformément et avec remplacement. Ce processus d'échantillonnage est connu sous le nom d'amorçage. Lorsque \( n' = n \), pour un grand \( n \), chaque \( D_i \) est censé contenir environ 63,2 % des échantillons uniques de \( D \), le reste étant des doublons. Cette fraction provient de la limite \( 1 - 1/e \). L'échantillonnage avec remplacement garantit que chaque échantillon d'amorçage est indépendant des autres, car la sélection de chaque échantillon ne dépend pas des sélections précédentes.

Après avoir généré les \( m \) échantillons d'amorçage, \( m \) modèles sont ajustés, un sur chaque échantillon. Pour les tâches de régression, la prédiction finale est la moyenne des sorties des modèles individuels. Pour les tâches de classification, la prédiction finale est déterminée par un vote, généralement un vote majoritaire.

Termes Clés : Jeux de Données Original, d'Amorçage et Hors-Sac

Dans l'agrégation par amorçage, trois types de jeux de données sont pertinents : le jeu de données original, le jeu de données d'amorçage et le jeu de données hors-sac. Le jeu de données original est la donnée d'entraînement fournie. Le jeu de données d'amorçage est créé en échantillonnant aléatoirement avec remplacement à partir du jeu original, et il a la même taille que celui-ci. Par exemple, si le jeu de données original se compose de 12 personnes nommées Emily, Jessie, George, Constantine, Lexi, Theodore, John, James, Rachel, Anthony, Ellie et Jamal, un échantillon d'amorçage pourrait inclure James, Ellie, Constantine, Lexi, John, Constantine, Theodore, Constantine, Anthony, Lexi, Constantine et Theodore. Ici, Constantine apparaît quatre fois, Lexi deux fois et Theodore deux fois.

Le jeu de données hors sac se compose des observations qui n'ont pas été sélectionnées dans l'échantillon d'amorçage. Dans l'exemple, l'ensemble hors sac serait Emily, Jessie, George, Rachel et Jamal. Comme les ensembles ignorent les doublons, la différence est prise entre l'ensemble original et les éléments uniques de l'ensemble d'amorçage.

Application aux Arbres de Décision et aux Forêts Aléatoires

Le bagging est souvent utilisé avec les arbres de décision, conduisant à la création de forêts aléatoires. Dans une forêt aléatoire, chaque arbre est entraîné sur un échantillon d'amorçage, et en plus, à chaque division, seul un petit sous-ensemble aléatoire de caractéristiques est considéré. Cela introduit une diversité supplémentaire parmi les arbres, rendant l'ensemble plus robuste.

Pour construire un arbre de décision à partir d'un jeu de données d'amorçage, l'algorithme examine chaque caractéristique et détermine dans quelle mesure elle sépare les échantillons en classes positives et négatives. Cela est souvent fait à l'aide d'une matrice de confusion, qui liste les vrais positifs, les faux positifs, les vrais négatifs et les faux négatifs. Les caractéristiques sont classées en fonction de métriques telles que le gain d'information ou une mesure de « qualité ». La meilleure caractéristique est utilisée pour partitionner les échantillons en deux ensembles : ceux qui possèdent la caractéristique et ceux qui ne la possèdent pas. Ce processus est répété récursivement pour chaque sous-ensemble jusqu'à ce qu'un critère d'arrêt, tel qu'une profondeur maximale, soit atteint. Aux feuilles, les échantillons sont classés comme positifs ou négatifs selon la classe majoritaire.

Les forêts aléatoires, qui combinent le bagging avec une sélection aléatoire de caractéristiques, ont montré une grande précision et sont largement utilisées en pratique. Le nombre d'arbres dans la forêt affecte les performances ; par exemple, un modèle avec 50 arbres donne généralement de meilleurs résultats qu'un modèle avec 10 arbres, car la probabilité qu'une observation soit exclue de tous les échantillons d'amorçage diminue avec davantage d'arbres.

Effets sur Différents Algorithmes

Le bagging conduit à des améliorations pour les procédures instables, qui incluent les réseaux de neurones artificiels, les arbres de classification et de régression, et la sélection de sous-ensembles dans la régression linéaire. Il a également été démontré qu'il améliore l'apprentissage de préimage. En revanche, le bagging peut légèrement dégrader les performances des méthodes stables telles que les k-plus proches voisins, car la moyenne sur des modèles similaires ne réduit pas significativement la variance et peut introduire un biais.

Aperçus Théoriques

L'efficacité du bagging repose sur la réduction de la variance. Pour un modèle à forte variance, comme un arbre de décision profond, de petites perturbations dans les données d'entraînement peuvent conduire à des modèles très différents. En faisant la moyenne de plusieurs modèles entraînés sur des échantillons d'amorçage, la variance de la prédiction finale est réduite, souvent sans augmentation significative du biais. Cela est particulièrement important dans les contextes de grande dimension, comme ceux rencontrés dans apprentissage profond et grands modèles de langage.

Considérations Pratiques

Le bagging est facilement parallélisable, car les modèles sont entraînés indépendamment les uns des autres, ce qui le rend adapté aux pipelines d'apprentissage automatique à grande échelle, y compris ceux utilisant Amazon Web Services et Google Cloud. Le nombre d'échantillons d'amorçage \( m \) est souvent choisi en fonction des ressources disponibles, allant généralement de 10 à quelques centaines. Un plus grand nombre de modèles tend à réduire la variance, mais au prix d'un coût computationnel plus élevé.

Aperçus Théoriques

L'efficacité du bagging repose sur la réduction de la variance. Pour un modèle à forte variance, comme un arbre de décision profond, de petites perturbations dans les données d'entraînement peuvent conduire à des modèles très différents. En faisant la moyenne de plusieurs modèles entraînés sur des échantillons d'amorçage, la variance de la prédiction finale est réduite, souvent sans augmentation significative du biais. Cela est particulièrement important dans les contextes de grande dimension, comme ceux rencontrés dans les applications de apprentissage profond et d'intelligence artificielle.

Considérations Pratiques

Le bagging est efficace sur le plan computationnel car chaque modèle peut être entraîné indépendamment, ce qui facilite la parallélisation. Cela a contribué à sa popularité dans les pipelines d'apprentissage automatique à grande échelle, y compris ceux utilisés par les fournisseurs de cloud comme Google Cloud et Amazon Web Services. En pratique, le nombre d'échantillons d'amorçage \( m \) est souvent choisi en fonction des ressources informatiques disponibles, allant généralement de 10 à quelques centaines.

Relation avec d'Autres Méthodes d'Ensemble

Le bagging est étroitement lié à d'autres techniques d'ensemble, telles que le boosting et l'empilement. Alors que le boosting se concentre sur la correction des erreurs de manière séquentielle, le bagging entraîne les modèles en parallèle et combine leurs prédictions par moyenne ou vote. Cette distinction rend le bagging particulièrement adapté à la réduction de la variance, tandis que le boosting est plus efficace pour réduire le biais. Les forêts aléatoires, une implémentation spécifique du bagging avec des arbres de décision, comptent parmi les méthodes d'ensemble les plus utilisées en apprentissage automatique.

Conclusion

Le bagging reste une technique fondamentale en apprentissage automatique, offrant un moyen simple mais puissant d'améliorer la stabilité et la précision des modèles. Ses principes sous-tendent des méthodes avancées et restent pertinents dans les applications modernes, des données tabulaires traditionnelles aux domaines complexes comme les réseaux de neurones et les grands modèles de langage.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:ensemble-learning·machine-learning·statistical-classification
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique