Séries temporelles structurelles bayésiennes

Traduit de l'anglais

La série temporelle structurelle bayésienne (BSTS) est une méthode statistique pour la prévision de séries temporelles et l'inférence causale, combinant des modèles d'espace d'états avec l'inférence bayésienne pour gérer l'incertitude et les données manquantes.

Bayesian structural time series (BSTS) est un cadre statistique pour la modélisation et la prévision de séries temporelles. Il intègre des modèles espace-état avec l'inférence bayésienne, permettant la décomposition d'une série en composantes de tendance, saisonnières et de régression, tout en fournissant des distributions a posteriori complètes pour tous les paramètres. Cette approche est particulièrement appréciée pour sa capacité à gérer les données manquantes, à incorporer des informations a priori et à quantifier l'incertitude dans les prédictions et les estimations d'effets causaux.

La méthode a été popularisée au milieu des années 2010 grâce à des travaux académiques et des implémentations open-source, notamment le package CausalImpact développé par Google. BSTS est devenu un outil standard dans des domaines tels que l'économétrie, l'épidémiologie et l'analyse marketing, où la compréhension de l'impact d'interventions ou d'événements sur une série temporelle est cruciale. Sa flexibilité et sa nature probabiliste le distinguent des méthodes classiques de séries temporelles comme ARIMA, qui exigent souvent la stationnarité et traitent les paramètres comme fixes.

Composantes principales

Les modèles BSTS reposent sur une représentation espace-état, où une série temporelle observée \( y_t \) est exprimée comme une fonction d'un vecteur d'état latent \( \alpha_t \). L'équation d'observation est typiquement \( y_t = Z_t^T \alpha_t + \varepsilon_t \), et l'état évolue selon \( \alpha_{t+1} = T_t \alpha_t + R_t \eta_t \), avec des termes d'erreur \( \varepsilon_t \) et \( \eta_t \) supposés gaussiens. Le vecteur d'état peut inclure plusieurs composantes : une tendance linéaire locale, une composante saisonnière (souvent modélisée avec des termes de Fourier ou des variables muettes) et des coefficients de régression pour des prédicteurs externes.

Une caractéristique clé est l'utilisation de priors spike-and-slab sur les coefficients de régression. Cette distribution a priori permet au modèle d'effectuer automatiquement une sélection de variables, en réduisant les coefficients non pertinents à zéro tout en conservant les prédicteurs importants. Cela est particulièrement utile lorsque le nombre de covariables potentielles est grand par rapport à la taille de l'échantillon, une situation courante dans les études observationnelles.

Inférence bayésienne et calcul

L'inférence dans BSTS est menée par des méthodes de Monte Carlo par chaînes de Markov (MCMC), généralement en utilisant l'échantillonnage de Gibbs. La structure espace-état permet un échantillonnage efficace des états latents via le filtre de Kalman et le lisseur, tandis que les coefficients de régression et les paramètres de variance sont mis à jour conditionnellement. L'approche bayésienne produit une distribution a posteriori pour chaque quantité, permettant des intervalles de crédibilité pour les prévisions et les estimations d'effets.

Un avantage pratique est la gestion naturelle des observations manquantes. Dans un cadre espace-état, les valeurs manquantes sont traitées comme des variables latentes et sont imputées pendant le processus d'échantillonnage, évitant le besoin d'étapes d'imputation séparées. Cela est particulièrement bénéfique pour les ensembles de données réels avec des lacunes dues à des retards de rapport ou à des problèmes de collecte de données.

Analyse d'impact causal

Une application prominente de BSTS est l'estimation d'impact causal, comme implémentée dans le package R CausalImpact. La méthode construit un contrôle synthétique pour une unité traitée en ajustant un modèle BSTS à un ensemble de séries temporelles de contrôle pendant une période pré-intervention. Le modèle apprend la relation entre la série traitée et les contrôles, puis prédit le résultat contrefactuel pour la période post-intervention. La différence entre les valeurs observées et prédites fournit une estimation de l'effet causal, complète avec des intervalles d'incertitude.

Cette approche a été largement utilisée pour évaluer l'effet de campagnes marketing, de changements de politique ou d'interventions de santé publique. Par exemple, les chercheurs l'ont appliquée pour mesurer l'impact des dépenses publicitaires sur les ventes ou l'effet d'une nouvelle loi sur les accidents de la route. La force de la méthode réside dans sa capacité à prendre en compte les tendances et la saisonnalité sans nécessiter une expérience randomisée.

Implémentations logicielles

Plusieurs packages logiciels implémentent BSTS. Le package original CausalImpact, publié par Google en 2014, reste populaire en R. Le package R bsts, également de Google, fournit un cadre plus général pour construire des modèles espace-état personnalisés. En Python, la bibliothèque pycausalimpact offre un port de CausalImpact, et la bibliothèque statsmodels inclut certaines fonctionnalités espace-état, bien qu'avec moins d'accent sur la sélection de variables bayésienne.

Ces outils ont abaissé la barrière à l'entrée, permettant aux praticiens sans expertise approfondie en statistiques bayésiennes d'appliquer BSTS. Cependant, les utilisateurs doivent toujours faire des choix de modélisation, tels que le nombre de composantes saisonnières ou la distribution a priori pour les coefficients de régression, ce qui peut influencer les résultats.

Limites et considérations

BSTS est intensif en calcul par rapport aux méthodes classiques, surtout pour des séries longues ou de nombreuses covariables, en raison de l'échantillonnage MCMC. Des diagnostics de convergence sont nécessaires pour garantir des estimations a posteriori fiables. La méthode suppose également la linéarité et des erreurs gaussiennes, ce qui peut ne pas convenir aux données de comptage ou aux distributions fortement asymétriques, bien que des extensions existent pour les familles de Poisson et d'autres.

Une autre limite est la dépendance au choix des séries de contrôle dans les applications causales. Si les contrôles sont de mauvais prédicteurs ou sont eux-mêmes affectés par l'intervention, les estimations contrefactuelles peuvent être biaisées. Malgré ces défis, BSTS reste un outil robuste et flexible, comblant le fossé entre l'économétrie traditionnelle et les approches modernes d'apprentissage automatique.

Concepts connexes

BSTS est lié aux domaines plus larges de apprentissage automatique et intelligence artificielle, en particulier dans les applications de prévision. Il partage un terrain conceptuel avec les modèles séquence-à-séquence et les architectures encodeur-décodeur, qui traitent également les dépendances temporelles, bien que BSTS mette l'accent sur l'interprétabilité et la quantification de l'incertitude. La méthode se connecte également aux techniques de augmentation de données, car l'imputation des données manquantes est une caractéristique centrale. Dans le contexte de IA générative, BSTS peut être utilisé pour générer des scénarios contrefactuels réalistes, bien qu'il ne s'agisse pas d'une approche basée sur les réseaux de neurones.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:time-series·bayesian-inference·causal-inference·statistical-modeling
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique