ベイズ構造時系列(BSTS)は、時系列データをモデル化し予測するための統計的枠組みである。これは状態空間モデルとベイズ推論を統合し、系列をトレンド、季節成分、回帰成分に分解することを可能にし、すべてのパラメータに対して完全な事後分布を提供する。このアプローチは、欠測データの処理、事前情報の組み込み、予測および因果効果推定における不確実性の定量化が可能な点で特に評価されている。
この手法は、2010年代半ばに学術研究とオープンソース実装、特にGoogleが開発したCausalImpactパッケージを通じて普及した。BSTSは、計量経済学、疫学、マーケティング分析などの分野で標準的なツールとなっており、介入やイベントが時系列に与える影響を理解することが重要である。その柔軟性と確率的性質は、定常性を要求しパラメータを固定として扱うことが多いARIMAのような古典的な時系列手法とは区別される。
中核的構成要素
BSTSモデルは状態空間表現に基づいており、観測された時系列 \( y_t \) は潜在状態ベクトル \( \alpha_t \) の関数として表現される。観測方程式は通常 \( y_t = Z_t^T \alpha_t + \varepsilon_t \) であり、状態は \( \alpha_{t+1} = T_t \alpha_t + R_t \eta_t \) に従って進化し、誤差項 \( \varepsilon_t \) と \( \eta_t \) はガウス分布に従うと仮定される。状態ベクトルには複数の成分を含めることができる:局所線形トレンド、季節成分(多くの場合フーリエ項またはダミー変数でモデル化)、および外部予測変数の回帰係数である。
重要な特徴は、回帰係数に対するスパイク・アンド・スラブ事前分布の使用である。この事前分布により、モデルは自動的に変数選択を実行し、関連性のない係数をゼロに縮小しながら重要な予測変数を保持することができる。これは、潜在的な共変量の数がサンプルサイズに比べて大きい場合、観察研究で一般的なシナリオで特に有用である。
ベイズ推論と計算
BSTSにおける推論は、マルコフ連鎖モンテカルロ(MCMC)法、通常はギブスサンプリングを用いて行われる。状態空間構造により、カルマンフィルタとスムーザーを介した潜在状態の効率的なサンプリングが可能であり、回帰係数と分散パラメータは条件付きで更新される。ベイズ的アプローチは、すべての量に対して事後分布を生成し、予測および効果推定に対する信用区間を可能にする。
実用的な利点の一つは、欠測観測の自然な処理である。状態空間の枠組みでは、欠測値は潜在変数として扱われ、サンプリングプロセス中に補完されるため、別途の補完ステップが不要となる。これは、報告遅延やデータ収集の問題によるギャップがある実世界のデータセットに特に有益である。
因果影響分析
BSTSの顕著な応用は、CausalImpact Rパッケージに実装されている因果影響推定である。この手法は、介入前期間に一連の対照時系列にBSTSモデルを適合させることにより、処理単位の合成対照を構築する。モデルは処理系列と対照の間の関係を学習し、介入後期間の反事実結果を予測する。観測値と予測値の差は、不確実性区間を含む因果効果の推定を提供する。
このアプローチは、マーケティングキャンペーン、政策変更、公衆衛生介入の効果を評価する際に広く使用されている。例えば、研究者は広告費が売上に与える影響や、新しい法律が交通事故に与える効果を測定するためにこれを適用している。この手法の強みは、ランダム化実験を必要とせずにトレンドと季節性を考慮できる点にある。
ソフトウェア実装
いくつかのソフトウェアパッケージがBSTSを実装している。2014年にGoogleがリリースした元のCausalImpactパッケージは、Rで人気が続いている。同じくGoogleのbsts Rパッケージは、カスタム状態空間モデルを構築するためのより一般的な枠組みを提供する。Pythonでは、pycausalimpactライブラリがCausalImpactの移植版を提供し、statsmodelsライブラリにはいくつかの状態空間機能が含まれているが、ベイズ変数選択への重点は少ない。
これらのツールは参入障壁を低くし、ベイズ統計の深い専門知識を持たない実務者がBSTSを適用できるようにした。しかし、ユーザーは依然として、季節成分の数や回帰係数の事前分布などのモデリング選択を行う必要があり、これらは結果に影響を与える可能性がある。
制限と考慮事項
BSTSは、MCMCサンプリングのため、古典的な手法と比較して計算集約的であり、特に長い系列や多くの共変量の場合に顕著である。信頼できる事後推定を確保するためには、収束診断が必要である。この手法はまた、線形性とガウス誤差を仮定しており、カウントデータや高度に歪んだ分布には当てはまらない場合があるが、ポアソンや他のファミリーに対する拡張が存在する。
もう一つの制限は、因果応用における対照系列の選択への依存である。対照が予測力の低いものや、介入自体の影響を受ける場合、反事実推定は偏る可能性がある。これらの課題にもかかわらず、BSTSは堅牢で柔軟なツールであり、伝統的な計量経済学と現代の機械学習アプローチの間のギャップを埋めるものである。
関連概念
BSTSは、特に予測応用において、Machine learningやArtificial intelligenceのより広い分野に関連している。これは、時間的依存性を扱うSequence-to-Sequence (Seq2Seq)モデルやEncoder-Decoder Architectureアーキテクチャと概念的な共通点を共有しているが、BSTSは解釈可能性と不確実性の定量化を強調する。この手法はまた、欠測データ補完が中核的な特徴であるため、Data Augmentation技術にも関連する。Generative AIの文脈では、BSTSは現実的な反事実シナリオを生成するために使用できるが、ニューラルネットワークベースのアプローチではない。