ブートストラップ集約(バギングとして広く知られる)は、予測モデルの精度と頑健性を向上させることを目的とした、機械学習におけるアンサンブル学習法の一つである。この手法は、元のトレーニングデータセットから複数のブートストラップサンプル(復元抽出によるランダムな部分集合)を生成し、各サンプルに対して個別のベースモデルを訓練し、それらの予測を集約することで機能する。回帰タスクでは、最終的な予測は通常、全ベースモデルの出力の平均であり、分類では多数決によって決定される。バギングは主に分散を低減し、過学習を抑えるのに役立ち、決定木のような高分散アルゴリズムに対して特に効果的である。
この手法は、1994年にレオ・ブレイマンが論文「Bagging Predictors」で発表した。これはアンサンブル学習の基礎的な概念であり、逐次的に誤りを修正するブースティングや、メタ学習器を介して多様なモデルを組み合わせるスタッキングとは区別される。バギングは実務で広く使用されており、特に特徴量のサブサンプリングと組み合わせたランダムフォレストの中核として最も顕著である。その単純さと有効性により、学術研究から金融、医療に至る産業応用まで、標準的なツールとなっている。
歴史的発展
バギングは、複数のモデルを組み合わせて汎化性能を向上させることへの関心が高まった1990年代初頭の、より広範な統計学および機械学習研究から生まれた。カリフォルニア大学バークレー校の統計学者であるレオ・ブレイマンは、ブラッドリー・エフロンによるブートストラップ法に関する初期の研究に基づき、1994年にこのアプローチを体系化した。ブレイマンは、摂動されたデータセットで訓練されたモデルの予測を平均化することで、特にデータのわずかな変動で出力が大きく変化する不安定な学習器において、誤差を低減できることを理論的かつ実証的に示した。
この手法は、2001年にブレイマンがランダムフォレストを発表した後、急速に普及した。ランダムフォレストは、決定木の各分割において特徴量の部分集合もランダムに選択することでバギングを拡張したものである。この革新によりベースモデル間の相関がさらに低減され、大幅な性能向上がもたらされた。それ以来、バギングはscikit-learn、RのrandomForestパッケージ、TensorFlow Decision Forestsなど、数多くのソフトウェアライブラリに統合され、世界中の実務者が利用できるようになった。
アルゴリズムの詳細
バギングアルゴリズムは単純な手順で進行する。サイズnのトレーニングセットが与えられた場合、このプロセスは、それぞれサイズnのB個のブートストラップサンプルを、復元抽出により一様に生成する。これは、一部の元のインスタンスがサンプル内に複数回現れる一方で、他のインスタンスは省略されることを意味する(任意のサンプルには約63.2%の一意なインスタンスが現れ、残りは重複である)。各サンプルに対して、ベースモデルが独立に訓練され、多くの場合、同じアルゴリズムとハイパーパラメータが使用される。ベースモデルは決定木、ニューラルネットワーク、その他の学習器であり得る。
集約はタスクに依存する。回帰の場合、予測は平均化される: \( \hat{f}(x) = \frac{1}{B} \sum_{b=1}^{B} \hat{f}_b(x) \)。分類の場合、最終的なクラスはベースモデル間の多数決によって決定される。ブートストラップサンプルの数Bは重要なハイパーパラメータであり、典型的な値は50から500の範囲で、数百を超えると効果は逓減する。バギングはベースモデルに対して交差検証を必要としない。これは、アウト・オブ・バッグサンプル(特定のブートストラップサンプルに含まれないインスタンス)を使用して、別途の検証セットなしで汎化誤差を推定できるためである。
理論的基盤
バギングの有効性は分散の低減に由来する。予測分散 \( \sigma^2 \) とモデル間のペアワイズ相関 \( \rho \) を持つベースモデルの場合、アンサンブル平均の分散は近似的に \( \rho \sigma^2 + (1-\rho)\sigma^2/B \) となる。Bが増加すると、第二項は消滅し、 \( \rho \sigma^2 \) が残る。したがって、バギングはベースモデルが不安定(高分散)であるが、あまり相関していない場合に最も効果的である。決定木は、データのわずかな摂動が異なる分割をもたらすが、全体的な構造は十分に類似したままで相関を適度に保つため、理想的である。
ブレイマンの当初の分析では、ベース学習器が不安定である場合、バギングは回帰の平均二乗誤差と分類の誤分類率を低減できることが示された。線形回帰のような安定した学習器では、分散がすでに低いため、大きな効果はない。この手法はまた、ベースモデルの予測のばらつきを通じて不確実性を推定する自然なメカニズムも提供し、予測区間の構築に使用できる。
実用的応用
バギングは多様な分野で応用されている。金融では、誤検出を減らすことが重要な信用スコアリングや不正検出に使用される。医療では、バギングされた決定木が電子健康記録から患者の転帰を予測し、疾患を診断するのに役立つ。リモートセンシングでは、ランドカバーを衛星画像から分類するためにランダムフォレスト(バギングの変種)が使用される。この手法は自然言語処理のテキスト分類でも一般的であるが、深層学習モデルはしばしば他の正則化手法に依存する。
注目すべき応用の一つは、Machine learningコンペティションにおけるアンサンブル手法であり、バギングはブースティングと組み合わせたり、予測を安定させる最終ステップとして使用されたりすることが多い。例えば、Netflix PrizeやKaggleコンペティションでは、参加者は最良のモデルをバギングしてわずかな精度向上を引き出すことが多い。業界では、Amazon Web ServicesやGoogle Cloudなどの企業が、バギング実装を含むマネージドサービスを提供しており、手動でのオーケストレーションなしでスケーラブルなモデル訓練を可能にしている。
限界と拡張
バギングにはいくつかの限界がある。バイアスは低減されない。ベースモデルが体系的に過小適合している場合、バギングはそれを修正しない。また、ベースモデルの数に比例して計算コストが増加するが、各モデルは独立しているため訓練は容易に並列化できる。多くのモデルを保存する場合、メモリ使用量が高くなる可能性がある。さらに、単一モデルがすでに十分に汎化する非常に大規模なデータセットや、線形サポートベクターマシンのような安定したアルゴリズムでは、バギングの効果は低い。
拡張はこれらの問題の一部に対処する。ランダムフォレストは、ツリー間の相関をさらに低減するために特徴量サブサンプリングを追加する。ペースティング(またはサブバギング)は、復元なしでより小さなランダムサンプルで訓練し、計算負荷を低減する。ブラギング(勾配ブースティングを伴うブートストラップ集約)は、バギングとブースティングを組み合わせて精度を向上させる。ニューラルネットワークでは、ディープアンサンブルと呼ばれる関連手法が、異なるランダム初期化で複数のネットワークを訓練し、事実上、重みレベルでバギングを適用する。これらの変種は、現代のアンサンブル学習に対するブレイマンの当初のアイデアの永続的な影響を浮き彫りにしている。