フィーチャーエンジニアリングは、教師あり機械学習および統計モデリングにおける前処理ステップであり、生データをより効果的な入力セットに変換する。各入力は、特徴量として知られる複数の属性で構成される。モデルに関連情報を提供することで、フィーチャーエンジニアリングは予測精度と意思決定能力を大幅に向上させる。その原理は機械学習を超えて、物理学などの科学分野にも拡張される。そこでは、流体力学におけるレイノルズ数、熱伝達におけるヌッセルト数、沈降におけるアルキメデス数などの無次元数が構築され、材料力学の解析解が一次近似として開発される。
クラスタリング応用
フィーチャーエンジニアリングは、データセット内の特徴オブジェクトやサンプルオブジェクトのクラスタリングに広く使用される。行列分解に基づく手法、特に特徴係数に対する非負制約を持つ手法が広く適用される。これには、非負行列因子分解(NMF)、非負行列三重因子分解(NMTF)、非負テンソル分解/因子分解(NTF/NTD)が含まれる。非負制約は部分ベース表現を生成し、異なる因子行列は自然なクラスタリング特性を示す。拡張には、ハードクラスタリングのための直交制約付き因子分解や、アルゴリズム固有の問題に対処するための多様体学習が含まれる。
他のアプローチは、複数の相互関連データセットにわたる共通の隠れた構造を活用して、コンセンサスクラスタリングを取得する。コンセンサス行列分解に基づくマルチビュー分類(MCMD)は、データセット間で共通のクラスタリングスキームを発掘し、スケール変動およびスケール不変のクラスラベルを出力し、欠落情報に対して堅牢であり、形状およびスケールベースの外れ値を検出でき、高次元データを効果的に処理する。結合行列およびテンソル分解は、マルチビューフィーチャーエンジニアリングで人気がある。
予測モデリング
機械学習および統計モデリングにおいて、フィーチャーエンジニアリングには、特徴量の選択、作成、変換、抽出が含まれる。主要な構成要素には、既存データからの特徴量作成、欠落または無効な特徴量の変換および補完、主成分分析(PCA)、独立成分分析(ICA)、線形判別分析(LDA)などの方法による次元削減、および重要度スコアと相関行列に基づく関連特徴量の選択が含まれる。
特徴量は重要性が異なり、比較的重要でない特徴量でもモデルに寄与する場合がある。特徴量選択は、過学習を防ぐために特徴量の数を減らすことができる。特徴量爆発は、特定された特徴量の数が効果的なモデル推定には多すぎる場合に発生し、多くの場合、線形システムで表現できない特徴量テンプレートや特徴量組み合わせによって引き起こされる。これは、正則化、カーネル法、特徴量選択によって制限できる。
特徴量テンプレート
特徴量テンプレートは、トレーニングセットとテストセットの各インスタンスから特徴量セットを自動的に生成するために使用される特徴量の抽象仕様である。これにより、大量の特定特徴量を自動生成でき、手動コーディングの労力を削減できる。
自動化
フィーチャーエンジニアリングの自動化は1990年代から研究テーマであり、2016年以降、それを組み込んだ商用機械学習ソフトウェアが利用可能となっている。学術文献は主に、多関係決定木学習(MRDTL)と深層特徴合成の2つのタイプに分けられる。
多関係決定木学習(MRDTL)
MRDTLは、従来の決定木手法をリレーショナルデータベースに拡張し、テーブル間の複雑なデータ関係を処理する。選択グラフを決定ノードとして使用し、終了基準に達するまで体系的に洗練する。ほとんどの実装はリレーショナルデータベースに基づいており、冗長な操作が発生するが、タプルID伝播などの技術を使用して削減できる。
オープンソース実装
リレーショナルデータおよび時系列データのフィーチャーエンジニアリングを自動化するオープンソースライブラリがいくつかある:
- featuretools:時系列およびリレーショナルデータを特徴行列に変換するPythonライブラリ。
- MCMD:複数データセットの共同クラスタリングのためのオープンソースアルゴリズム。
- OneBM(ワンボタンマシン):リレーショナルデータの特徴変換と選択を組み合わせ、データ探索時間を短縮。
- getML community:Pythonインターフェースを備えたC/C++ツールで、tsflex、tsfresh、tsfel、featuretools、またはkatsよりも少なくとも60倍高速。
- tsfresh:時系列特徴抽出のためのPythonライブラリで、仮説検定による特徴品質を評価。
- tsflex:時系列特徴のためのPythonライブラリで、tsfresh、seglearn、またはtsfelよりも高速かつメモリ効率が高い。
- seglearn:多変量、逐次時系列データをscikit-learnに拡張する拡張機能。
- tsfel:時系列特徴抽出のためのPythonパッケージ。
- kats:時系列分析のためのPythonツールキット。
深層特徴合成
深層特徴合成(DFS)アルゴリズムは、コンペティションで906の人間チームのうち615を上回り、その有効性を示した。
特徴ストア
特徴ストアは、モデルのトレーニングや予測を行う明確な目的のために特徴量を保存および整理する中央リポジトリである。データサイエンティストは特徴量のグループを作成または更新でき、異なるモデルやアプリケーション間での一貫性と再利用性を確保できる。
関連項目
- 機械学習
- 人工知能
- 深層学習
- ニューラルネットワーク
- 大規模言語モデル
- トランスフォーマー
- 生成AI
- OpenAI
- Anthropic
- Google DeepMind
- Amazon Web Services
- Azure
- Google Cloud
- Oracle Cloud
- CoreWeave
- Cerebras
- Groq
- SambaNova
- Graphcore
- Xerox PARC
- MIT CSAIL
- スタンフォードAIラボ
- トロント大学
- カーネギーメロン大学
- バークレーAI研究
- オックスフォード大学
- トーマス・ディータリッヒ
- マイケル・ジョーダン
- ダフネ・コラー
- アニマ・アナンドクマール
- サミー・ベンジオ
- ジョシュア・テネンバウム
- ブレンダン・レイク
- メラニー・ミッチェル
- アーロン・クールビル
- アレクサンダー・マドリー
- アレクセイ・エフロス
- アリ・ラヒミ
- バーナード・ウィドロー
- クリス・ビショップ
- クリストファー・ビショップ
- クレイグ・ブーティリエ
- エレイン・リッチ
- カルロス・ゲストリン
- ダフネ・レオン
- デビッド・ハ
- デビッド・ウィンガー
- ディーパック・クマール
- ドリュー・パケット
- エイロン・レシェフ
- フレディ・スリット
- ヤコブ・ウシュコレイト
- ウカシュ・カイザー
- ニキ・パーマー
- バレット・ゾフ
- マーク・チェン
- ブラッド・ライトキャップ
- ジェイコブ・スタインハート
- デビッド・カプラン
- ライアン・ロウ
- ジャック・クラーク
- シャン・カーター
- デビッド・ルアン
- チェン・ウー
- アシッシュ・クマール
- カレン・シモニャン
- コレイ・カブクチュオグル
- アラン・パーリス
- アンドリュー・ロイド・ブラウン
- アニ・バッタチャリヤ
- アンナ・パターソン
- アンナ・リッター
- アヌバフ・シンハ
- 荒川亮太
- アルカ・ダッタ
- アーサー・フランツ
- ベン・ゲルツェル
- ブライアン・チョン
- ブライアン・クリスチャン
- ブライアン・リリー・ホワイト
- カルボ・ラファエル
- キャサリン・フリック
- チャド・マーキン
- チン・イェン・チウ
- クレイグ・クー
- ダフナ・シャロン
- デビッド・フロイツハイム
- デビッド・マーティン
- ディーパック・クマール
- ドリュー・パケット
- エレイン・リッチ
- エイロン・レシェフ