決定木は、分類および回帰タスクの両方に使用される教師あり学習アルゴリズムの一群である。それらは、決定とその可能な結果を木構造としてモデル化し、内部ノードは入力特徴量に対するテストを表し、枝はそれらのテストの結果に対応し、葉ノードは最終的な予測を提供する。その解釈可能性と単純さにより、機械学習における基礎的なツールとなり、ランダムフォレストや勾配ブースティングなどのより高度なアンサンブル手法の構成要素として機能している。
核となるアイデアは統計学と心理学における初期の研究に遡り、1960年代と1970年代に重要な発展があった。1986年にRoss Quinlanによって導入されたID3アルゴリズムは、分割における情報利得の使用を普及させた。Quinlanは後にC4.5を開発し、これはカテゴリ特徴量と連続特徴量の両方を扱い、剪定を導入した。ほぼ同時期に、1984年にLeo Breimanとその同僚によって開発されたCART(分類および回帰木)フレームワークは、分類と回帰の両方を扱う能力で広く採用された。これらの基礎的な手法は今も影響力を持ち、scikit-learnのような現代の実装では最適化されたCARTのバージョンを使用している。
決定木の仕組み
決定木は、特徴空間を再帰的に分割することによって構築される。各ノードで、アルゴリズムは、Gini不純度や情報利得などの基準に従ってトレーニングデータを最もよく分離する特徴量と閾値を選択する。分類では、Gini不純度は、そのノードのクラス分布に従ってランダムに選ばれた要素にラベルを付けた場合に誤分類される確率を測定する。エントロピーから導出される情報利得は、分割後の不確実性の減少を定量化する。回帰では、分散減少が一般的に使用される。
木は、最大深さ、葉あたりの最小サンプル数、または純度のさらなる改善がないなどの停止基準が満たされるまで成長する。過学習を避けるために、剪定技術は予測力がほとんどない枝を除去する。このプロセスにより、フローチャートとして視覚化できるモデルが作成され、専門家でない人にも説明しやすくなる。
利点と限界
決定木の主な強みの1つは、その解釈可能性である。ニューラルネットワークや深層学習モデルとは異なり、決定木の決定は根から葉まで追跡でき、各予測に対して明確な説明を提供する。それらはデータ前処理をほとんど必要とせず、スケーリングやワンホットエンコーディングなしで数値特徴量とカテゴリ特徴量の両方を扱う。また、特徴量間の非線形関係や相互作用を自然に捉える。
しかし、決定木は高分散になりがちである。トレーニングデータの小さな変化が完全に異なる木につながる可能性があり、不安定になる。また、適切に制約または剪定されない場合、過学習しがちである。さらに、多くの水準を持つ特徴量に偏る可能性があり、調整なしでは高度に不均衡なデータセットではうまく機能しないことがある。これらの限界は、ランダムフォレストや勾配ブースティングなど、多くの木を組み合わせるアンサンブル手法によってしばしば緩和される。
応用と変種
決定木は、金融における信用スコアリング、医療における診断支援、マーケティングにおける顧客セグメンテーションなど、多くの分野で使用されている。その解釈可能性は、モデルの決定を説明しなければならない規制産業において特に価値がある。決定株(単一の分割を持つ木)のような変種はブースティングアルゴリズムで使用され、斜め決定木は各ノードで特徴量の線形結合を使用して表現力を向上させる。
現代の実践では、決定木は強力なアンサンブル技術の基本学習器として機能する。2001年にLeo Breimanによって導入されたランダムフォレストは、ブートストラップサンプル上に多くの木を構築し、その予測を平均化する。XGBoostやLightGBMなどの勾配ブースティングマシンは、前の木の誤差を修正する木を順次追加する。これらの手法は多くの機械学習コンペティションを支配し、業界で広く展開されており、表形式データではより複雑な深層学習モデルをしばしば上回る。
他のAIアプローチとの関係
決定木は、古典的なアルゴリズムと現代の深層学習手法の両方を含むより広い機械学習の分野に属する。ニューラルネットワークは大量のデータと計算リソースを必要とする一方、決定木は小さなデータセットから学習し、透明なモデルを提供できる。それらは多くのプロジェクトでベースラインモデルとして使用されることが多く、その性能はより洗練されたアプローチと比較して驚くほど強いことがある。
人工知能の文脈では、決定木は明示的なルールを生成するため、記号的学習の一形態と見なされる。これはニューラルネットワークの下記号的表現とは対照的である。研究者はまた、決定木とニューラルネットワークを組み合わせることも探求しており、例えば微分可能な分割関数を使用して勾配降下法で訓練できるソフト決定木などがある。これらのハイブリッドモデルは、解釈可能性を維持しながら深層学習の力を活用することを目指している。
結論
決定木は、その単純さ、解釈可能性、および有効性により、機械学習の基礎であり続けている。それらはスタンドアロンモデルとしてだけでなく、より強力なアンサンブルの構成要素としても有用である。分野が進化するにつれて、決定木は新しい技術に適応し統合され続けており、研究と実用的応用の両方での関連性を確保している。