La régularisation par filet élastique est une méthode utilisée dans le Machine learning et les statistiques pour prévenir le surapprentissage en ajoutant un terme de pénalité à la fonction de perte lors de l’entraînement du modèle. Elle a été introduite par Hui Zou et Trevor Hastie en 2005 comme un compromis entre la régression ridge (régularisation L2) et le lasso (régularisation L1). Cette technique est particulièrement utile lorsqu’on traite des ensembles de données contenant de nombreuses variables prédictives corrélées, car elle peut sélectionner des groupes de caractéristiques corrélées tout en réduisant leurs coefficients, ce qui constitue un avantage clé par rapport au lasso seul.
La pénalité du filet élastique est définie comme une somme pondérée des normes L1 et L2 du vecteur de coefficients. Mathématiquement, elle ajoute le terme \(\lambda_1 \sum |\beta_j| + \lambda_2 \sum \beta_j^2\) à la fonction de perte, où \(\lambda_1\) et \(\lambda_2\) sont des paramètres de réglage qui contrôlent la force de chaque pénalité. En pratique, elle est souvent exprimée avec un paramètre unique \(\alpha\) qui mélange les deux pénalités, et une force de régularisation totale \(\lambda\). Cette formulation permet au modèle d’effectuer simultanément la sélection de caractéristiques (comme le lasso) et la réduction des coefficients (comme la ridge).
Contexte historique
Le développement de la régularisation par filet élastique a répondu à une limitation connue de la méthode du lasso. Le lasso, introduit en 1996 par Robert Tibshirani, est efficace pour la sélection de caractéristiques parcimonieuses mais peut se comporter de manière erratique lorsque les prédicteurs sont fortement corrélés ; il tend à sélectionner une seule variable d’un groupe corrélé et à ignorer les autres. La régression ridge, en revanche, gère mieux les caractéristiques corrélées mais n’effectue pas de sélection de caractéristiques. Le filet élastique a été conçu pour combler cette lacune, et ses créateurs ont montré qu’il pouvait surpasser les deux méthodes dans des scénarios avec des prédicteurs groupés ou fortement corrélés.
Depuis son introduction, le filet élastique est devenu un outil standard dans l’apprentissage statistique et les applications en Artificial intelligence. Il est implémenté dans des bibliothèques largement utilisées telles que scikit-learn en Python et glmnet en R, ce qui le rend accessible tant pour la recherche que pour l’industrie.
Formulation mathématique
Dans le contexte de la régression linéaire, la fonction objectif du filet élastique minimise la somme des carrés des résidus plus la pénalité combinée. Pour une variable de réponse \(y\) et une matrice de prédicteurs \(X\), les coefficients \(\beta\) sont estimés en résolvant :
\[ \min_{\beta} \, \frac{1}{2n} \sum_{i=1}^n (y_i - x_i^T \beta)^2 + \lambda \left( \frac{1-\alpha}{2} \sum_{j=1}^p \beta_j^2 + \alpha \sum_{j=1}^p |\beta_j| \right) \]
Ici, \(\alpha\) varie de 0 à 1, où \(\alpha = 1\) correspond au lasso pur, et \(\alpha = 0\) correspond à la ridge pure. Le paramètre \(\lambda\) contrôle la force globale de la régularisation. La combinaison des deux normes encourage la parcimonie tout en stabilisant le chemin de solution lorsque les caractéristiques sont corrélées.
Applications dans le machine-learning
La régularisation par filet élastique est largement utilisée dans divers domaines du Machine learning, y compris les modèles de régression linéaire et logistique, les modèles linéaires généralisés, et même dans l’entraînement d’architectures de Neural network comme forme de décroissance des poids. En apprentissage profond, elle est moins courante que la régularisation L2 pure (souvent appelée décroissance des poids), mais elle a été appliquée dans des contextes où une connectivité parcimonieuse est souhaitée, comme dans certains types d’extraction de caractéristiques ou lorsqu’on traite des espaces d’entrée de haute dimension.
La méthode est particulièrement populaire en bioinformatique et en génomique, où les ensembles de données ont souvent des milliers de caractéristiques (par exemple, les niveaux d’expression génique) mais relativement peu d’échantillons. Dans de tels cas, le filet élastique aide à identifier un petit ensemble de biomarqueurs pertinents tout en tenant compte des corrélations entre les gènes. Il est également utilisé en économétrie et en finance pour la sélection de variables dans des modèles prédictifs avec de nombreux indicateurs économiques.
Comparaison avec d’autres techniques de régularisation
Le filet élastique diffère des autres approches de régularisation dans sa gestion des groupes de caractéristiques. Le lasso tend à choisir arbitrairement une caractéristique d’un groupe corrélé, ce qui peut conduire à des modèles instables. La régression ridge réduit tous les coefficients mais ne les met pas exactement à zéro, ce qui donne un modèle incluant toutes les caractéristiques. Le filet élastique combine ces propriétés, encourageant un effet de groupement où les caractéristiques fortement corrélées tendent à avoir des valeurs de coefficients similaires, et il peut les sélectionner toutes si elles sont également pertinentes.
Une autre technique connexe est le lasso adaptatif, qui attribue des poids différents aux pénalités en fonction d’estimations initiales, mais le filet élastique reste une alternative plus simple et souvent plus robuste. En pratique, le choix entre ces méthodes dépend de la structure des données et des objectifs de modélisation, comme la priorité donnée à l’interprétabilité ou à la précision de prédiction.
Considérations pratiques
Lors de l’utilisation du filet élastique, le réglage des paramètres \(\alpha\) et \(\lambda\) est crucial. Cela se fait généralement par validation croisée, où le modèle est entraîné et évalué sur des données de test pour trouver la combinaison qui minimise l’erreur de prédiction. La standardisation des prédicteurs est recommandée avant d’appliquer le filet élastique car le terme de pénalité est sensible à l’échelle ; des caractéristiques non standardisées seraient autrement pénalisées de manière inégale.
La méthode est efficace sur le plan computationnel même pour des problèmes de haute dimension, car des algorithmes de solution comme la descente par coordonnées peuvent gérer de grandes matrices creuses. Pour de très grands ensembles de données, des implémentations dans des cadres de calcul distribué comme apache spark ou Amazon Web Services peuvent faire évoluer l’approche, bien que l’algorithme de base reste le même.
En résumé, la régularisation par filet élastique offre un outil flexible et puissant pour la régression régularisée, équilibrant les forces du lasso et de la ridge. Sa capacité à gérer les caractéristiques corrélées tout en effectuant la sélection de caractéristiques en fait un ajout précieux à la boîte à outils des scientifiques des données et des chercheurs en Artificial intelligence et en statistiques.