勾配ブースティング

英語からの翻訳

勾配ブースティングは、機械学習のアンサンブル手法であり、モデルを段階的に構築し、任意の微分可能な損失関数を最適化するために、弱学習器を擬似残差に適合させることが多い。この手法では、しばしば決定木が用いられる。

勾配ブースティングは、回帰および分類タスクに使用される機械学習技術です。これはブースティング手法のファミリーに属し、複数の弱い予測モデルを単一の強いモデルに結合します。残差にモデルを適合させる従来のブースティングとは異なり、勾配ブースティングは関数空間で動作し、擬似残差を対象とすることで、任意の微分可能な損失関数の最適化を可能にします。弱学習器が決定木である場合、結果として得られるアルゴリズムは勾配ブースティング木と呼ばれ、通常、予測精度においてランダムフォレストを上回ります。

この手法は、データについてほとんど仮定を置かない単純な決定木であることが多い弱モデルのアンサンブルとして予測モデルを生成します。モデルは反復的に構築され、各新しいコンポーネントが前のアンサンブルの誤差を修正します。このアプローチは、以前のブースティングアルゴリズムを一般化し、現代の機械学習の基盤となり、産業界や研究で広く使用されています。

歴史

勾配ブースティングの概念的基盤は、ブースティングがコスト関数上の最適化アルゴリズムとして解釈できるというレオ・ブレイマンの観察に遡ります。明示的な回帰勾配ブースティングアルゴリズムは、1999年にジェローム・H・フリードマンによって開発され、2001年に洗練されました。同時に、ルー・メイソン、ジョナサン・バクスター、ピーター・バートレット、マーカス・フリーンが、より一般的な関数勾配ブースティングの視点を導入しました。彼らの研究は、ブースティングアルゴリズムを反復的な関数勾配降下法として位置づけ、コスト関数を関数空間で最適化し、負の勾配方向を指す弱仮説を選択しました。この視点は、回帰や分類をはるかに超えて、機械学習と統計の多くの分野でのブースティング手法の開発を促進しました。

アルゴリズム概要

勾配ブースティングは、M段階でモデルを構築します。各段階mで、現在のモデルF_mは新しい推定器h_mを追加することで改善されます。最小二乗回帰の場合、目標はサイズnのトレーニングセット上の平均二乗誤差を最小化することです。初期のF_1は、ターゲット値の平均を予測するだけかもしれません。その後の各段階で、アルゴリズムは残差を計算します。これは観測値と現在の予測値の差です。次に、弱学習器(通常は浅い決定木)をこれらの残差に適合させます。更新されたモデルはF_{m+1}(x) = F_m(x) + h_m(x)になります。このプロセスは、望ましい段階数に達するか、性能が頭打ちになるまで繰り返されます。

一般的な損失関数の場合、アルゴリズムは擬似残差を使用します。これは、モデルの予測に関する損失関数の負の勾配です。これにより、ロジスティック損失を用いた分類や、ペアワイズ損失を用いたランキングなど、さまざまなタスクを処理できます。

勾配ブースティング木

決定木が弱学習器として使用される場合、アルゴリズムは勾配ブースティング木として知られています。各木は通常小さく、過学習を防ぎモデルを解釈可能に保つために、葉の数が制限されることがよくあります。木は順次追加され、各木は前のアンサンブルが残した誤差に焦点を当てます。このアプローチは、表形式データで最先端の結果をもたらすことが多く、構造化データタスクにおいてランダムフォレストや時にはDeep learningモデルをも上回ります。

主要なハイパーパラメータには、木の数、各木の最大深さ、学習率(各木の寄与を縮小する)、および確率的勾配ブースティングのためのサブサンプリング比率が含まれます。L1およびL2ペナルティなどの正則化手法も、葉の重みに一般的に適用されます。

アプリケーションと実装

勾配ブースティングは、信用スコアリング、クリックスルー率予測、検索ランキング、バイオインフォマティクスなど、多くの分野でうまく適用されています。人気のあるオープンソースライブラリには、XGBoost、LightGBM、CatBoostがあり、並列トレーニングとGPUサポートを備えた最適化された実装を提供します。これらのツールは、勾配ブースティングを実務者に利用しやすくし、コンペティションや本番システムで広く採用されています。

この手法の柔軟性と強力な予測性能により、構造化データ上でNeural networkモデルと競合することが多く、Machine learningワークフローにおける標準的なベースラインとなっています。

他の手法との関係

勾配ブースティングは、ランダムフォレストやAdaBoostなどの他のアンサンブル手法と関連しています。ただし、逐次的なアプローチと任意の損失関数を最適化する能力において異なります。ランダムフォレストは木を独立に構築して予測を平均化する一方、勾配ブースティングは木を順次構築し、各木が前の誤差を修正します。これにより、精度が高くなることが多いですが、過学習を避けるために慎重なチューニングが必要です。

関数勾配の視点は、勾配ブースティングを関数空間での最適化に結び付け、この概念はArtificial intelligenceや統計的学習などの他の分野に影響を与えています。研究者はこのアイデアを多出力問題、生存分析、さらにはニューラルネットワークトレーニングに拡張しており、そこではブースティングに似たアイデアが残差学習に現れます。

制限と考慮事項

その強みにもかかわらず、勾配ブースティングには制限があります。ノイズの多いデータや外れ値に敏感であり、木の数が多すぎる場合や木が深すぎる場合に過学習する可能性があります。トレーニングは計算集約的であり、特に大規模データセットでは顕著ですが、現代の実装は効率的なアルゴリズムとハードウェアアクセラレーションでこれを軽減しています。解釈可能性は単一の決定木よりも低いですが、特徴重要度の測定や部分依存プロットが洞察を提供できます。

多くのMachine learning技術と同様に、ハイパーパラメータと損失関数の選択は性能に大きく影響し、実務者はモデルをチューニングするためにクロスバリデーションに依存することがよくあります。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·ensemble-methods·regression·classification
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴