Modèle additif généralisé pour la localisation, l'échelle et la forme

Traduit de l'anglais

Un modèle additif généralisé pour la localisation, l'échelle et la forme (GAMLSS) est un cadre statistique qui modélise non seulement la moyenne, mais aussi d'autres paramètres de distribution, tels que la variance et l'asymétrie, comme des fonctions flexibles des prédicteurs. Il étend les modèles additifs généralisés pour traiter des distributions de données complexes.

Un modèle additif généralisé pour la localisation, l'échelle et la forme (GAMLSS) est un cadre de modélisation statistique qui étend les modèles additifs généralisés (GAM) en permettant à tous les paramètres de la distribution d'une variable de réponse - pas seulement la moyenne - d'être modélisés comme des fonctions lisses des variables prédictives. Développé par R. A. Rigby et D. M. Stasinopoulos en 2005, GAMLSS fournit une approche flexible pour l'analyse de régression lorsque la variable de réponse suit des distributions non normales ou présente une hétéroscédasticité, une asymétrie ou un aplatissement qui ne peuvent pas être capturés par les modèles traditionnels ne modélisant que la moyenne.

Le cadre suppose que la variable de réponse suit une distribution paramétrique, et chaque paramètre de distribution (par exemple, localisation, échelle, forme) est lié à un prédicteur linéaire via une fonction de lien monotone. Les prédicteurs linéaires peuvent incorporer des termes linéaires, des termes polynomiaux, des splines de lissage, des effets aléatoires et d'autres composantes additives. L'estimation est généralement effectuée à l'aide d'une approche de vraisemblance pénalisée, souvent avec les algorithmes RS (Rigby et Stasinopoulos) ou CG (Cole et Green), qui maximisent itérativement la vraisemblance tout en pénalisant la rugosité des termes lisses.

Spécification du modèle

Dans un GAMLSS, la variable de réponse \(Y\) est supposée avoir une fonction de distribution \(F_Y(y|\theta)\), où \(\theta = (\theta_1, \theta_2, \ldots, \theta_p)\) est un vecteur de \(p\) paramètres de distribution. Pour chaque paramètre \(\theta_k\), un modèle est spécifié comme suit :

\[ g_k(\theta_k) = \eta_k = X_k \beta_k + \sum_{j=1}^{J_k} s_{kj}(x_{kj}) \]

où \(g_k\) est une fonction de lien monotone, \(X_k\) est une matrice de conception pour les effets fixes, \(\beta_k\) sont les coefficients, et \(s_{kj}\) sont des fonctions lisses des covariables \(x_{kj}\). Le nombre de paramètres \(p\) dépend de la distribution choisie ; par exemple, une distribution normale a deux paramètres (moyenne et écart type), tandis qu'une distribution t de Box-Cox en a quatre (localisation, échelle, asymétrie et aplatissement).

Estimation et algorithmes

Les paramètres d'un GAMLSS sont estimés en maximisant une fonction de vraisemblance pénalisée. Les termes de pénalité contrôlent la lissage des fonctions additives, empêchant le surajustement. Deux algorithmes principaux sont utilisés :

  • Algorithme RS : Une généralisation de l'algorithme de backfitting pour les GAM, qui parcourt les paramètres, mettant à jour chacun tout en maintenant les autres fixes. Il convient aux distributions où les paramètres sont orthogonaux ou presque.
  • Algorithme CG : Basé sur la méthode de Newton-Raphson, qui met à jour tous les paramètres simultanément. Il est plus efficace pour les distributions avec des paramètres corrélés mais peut être moins stable.

Les deux algorithmes permettent une sélection automatique des paramètres de lissage à l'aide de critères tels que le critère d'information d'Akaike (AIC) ou la validation croisée généralisée (GCV). Le package gamlss dans le langage de programmation R fournit une implémentation complète de ces méthodes, y compris une large gamme de distributions et de termes additifs.

Applications

Les GAMLSS ont été appliqués dans divers domaines où les variables de réponse présentent une variance non constante ou des formes non normales. En médecine, ils sont utilisés pour construire des courbes de croissance et des intervalles de référence, où la distribution des mesures (par exemple, l'indice de masse corporelle, la pression artérielle) change avec l'âge. En finance, ils modélisent la volatilité et les mesures de risque qui varient avec les conditions du marché. En écologie, ils analysent les données d'abondance des espèces avec surdispersion ou inflation de zéros. La flexibilité de modéliser les paramètres d'échelle et de forme rend les GAMLSS particulièrement utiles pour la régression quantile et pour l'analyse de données avec des queues lourdes ou des distributions asymétriques.

Relation avec d'autres modèles

Les GAMLSS généralisent plusieurs modèles existants. Lorsque seul le paramètre de localisation est modélisé et que la distribution est supposée normale avec une variance constante, GAMLSS se réduit à un GAM standard. Si les termes additifs sont linéaires, il devient un modèle linéaire généralisé (GLM) pour la localisation, l'échelle et la forme. Le cadre englobe également la régression distributionnelle, où tous les paramètres d'une distribution sont régressés sur des covariables. Cela se connecte aux approches modernes d'apprentissage automatique telles que apprentissage profond et réseaux de neurones, qui peuvent également modéliser les paramètres de distribution, bien que GAMLSS conserve des propriétés d'interprétabilité et d'inférence statistique.

Logiciel et implémentation

Le logiciel principal pour GAMLSS est le package gamlss dans R, publié pour la première fois en 2005 et continuellement mis à jour. Il comprend des fonctions pour ajuster, diagnostiquer et visualiser les modèles, ainsi que pour sélectionner les distributions et les termes de lissage. Le package prend en charge un grand nombre de distributions, y compris les types continus, discrets et mixtes. D'autres implémentations existent en Python et dans d'autres logiciels statistiques, mais le package R reste le plus complet. Le cadre a été étendu pour traiter les données longitudinales, les données spatiales et les réponses multivariées, élargissant son applicabilité dans la modélisation statistique.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:statistical-models·regression-analysis·nonparametric-statistics
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique