インスタンスベース学習は、メモリベース学習とも呼ばれ、新しい問題インスタンスを、メモリに保存されている以前に見た訓練インスタンスと比較することで予測を行う、機械学習アルゴリズムの一群です。計算が新しいインスタンスが観測されるまで延期されるため、これらのアルゴリズムは「怠惰な」学習と呼ばれることがあります。これは、訓練中に一般化されたモデルを構築し、その後生データを破棄する熱心な学習方法とは対照的です。
このアプローチは、別個の関数やルールセットを導出するのではなく、訓練インスタンス自体から直接仮説を構築するため、インスタンスベースと呼ばれます。これは、パターン認識やデータマイニングなどの分野における中核的な技術であり、訓練データが豊富であるがモデルの解釈可能性がそれほど重要ではない多くの実用的なシステムの基盤となっています。
方法
インスタンスベース学習アルゴリズムの例として、k近傍法(k-NN)アルゴリズムがあります。これは訓練セットのサブセットを保存し、新しいインスタンスの値やクラスを予測する際に、このインスタンスと訓練インスタンスとの間の距離や類似度を計算して決定を行います。分類の場合、k個の最近傍インスタンスは、多数決または距離重み付き投票によって組み合わせることができます。回帰の場合、それらの目標値は平均または重み付き平均によって組み合わせることができます。
距離メトリックと特徴量スケーリングの選択は、どのインスタンスが最近傍として識別されるかを変える可能性があります。一般的なメトリックには、ユークリッド距離、マンハッタン距離、およびこれらを一般化するミンコフスキー距離が含まれます。正規化や標準化などの特徴量スケーリングは、範囲が大きい次元が距離計算を支配しないようにします。他のインスタンスベースの方法には、局所重み付き回帰、ケースベース推論、および訓練例を難易度によって整理するカリキュラム学習の変種が含まれます。
計算特性
仮説の複雑さはデータとともに増大する可能性があります。最悪の場合、仮説はn個の訓練項目のリストであり、2つのインスタンスを比較するコストが一定と見なされる場合、単一の新しいインスタンスを分類する計算複雑性はO(n)です。計算を延期することで訓練は安価になりますが、予測時に計算が移行します。
単純なミンコフスキー距離を使用する基本的なk-NN分類器の場合、d個の特徴量で記述されたn個の保存サンプルに対する網羅的探索はO(dn)時間かかります。バランスの取れたk-dツリーは、取得時間をO(d log n)に削減できますが、この利点は特徴量の数が増えるにつれて減少します。高次元空間では、「次元の呪い」が性能を低下させる可能性があり、距離の判別力が低下します。訓練インスタンスの保存に必要なストレージと訓練セット内のノイズに対する感度を減らすために、凝縮最近傍法や編集最近傍法などのインスタンス削減アルゴリズムが提案されており、これらは冗長またはノイズの多いポイントを削除します。
応用と変種
インスタンスベース学習は、レコメンデーションシステム、医療診断、異常検出で広く使用されています。人工知能アプリケーションでは、深層学習ネットワークのようなより複雑なモデルを評価するためのベースラインとして機能します。変種には、近い近傍がより大きな影響を持つ重み付きk-NNや、訓練データを代表的な例示にクラスタリングするプロトタイプベースの方法が含まれます。大規模データセットの場合、局所性鋭敏型ハッシュなどの近似最近傍探索技術が、取得を高速化するためによく使用されます。
他の学習パラダイムとの関係
現代の大規模言語モデルで使用されるニューラルネットワークやトランスフォーマーとは異なり、インスタンスベースの方法はパラメータに対する反復最適化を必要としません。これらはノンパラメトリックであり、モデルの複雑さが訓練インスタンスの数とともに増大することを意味します。これにより、新しいデータでの更新が容易になりますが、大規模なデータセットではメモリ集約的になります。対照的に、残差ネットワークやU-Netアーキテクチャのような熱心な学習方法は、情報を固定サイズのパラメータに圧縮し、更新には再訓練を犠牲にして高速な推論を可能にします。
制限と拡張
主な制限は、特に高次元データでの予測時の計算コストです。インスタンス削減とインデックス構造はこれを緩和しますが、オーバーヘッドを導入します。無関係な特徴量やノイズに対する感度は、特徴量重み付けや距離メトリック学習によって対処できます。データ拡張のような拡張は、合成インスタンスを生成して堅牢性を向上させることができます。実際には、インスタンスベース学習は、小規模から中規模のデータセット、および解釈可能性とインクリメンタル学習が優先される問題に対して、依然として貴重なツールです。