インスタンス選択(インスタンス・セレクション)は、データセット削減またはデータセット凝縮とも呼ばれ、多くの機械学習およびデータマイニングタスクで適用されるデータ前処理ステップである。その主な目的は、元のデータセットを管理可能な規模に削減し、学習プロセスに必要な計算リソースを低減することである。さらに、インスタンス選択アルゴリズムは、学習前にノイズを含むインスタンスを除去できるため、分類問題における精度を向上させることができる。理想的な結果は、データセット全体を使用した場合と比較して性能低下なしに同じタスクを達成する最小のデータサブセットであり、削減率と分類品質の間のトレードオフが必要となる。
アルゴリズムのカテゴリ
インスタンス選択アルゴリズムは、保存するインスタンスのタイプによってグループ化される。1つのクラスは、クラス決定境界の近くに位置する境界インスタンスに焦点を当てる。このグループのアルゴリズムには、DROP3、ICF、LSBoが含まれる。もう1つのクラスは、各クラスの中心となる内部インスタンスを保存する。例としては、ENNやLSSmが挙げられる。これらの内部選択アルゴリズムは、有害またはノイズを含むインスタンスをフィルタリングするためによく使用され、境界選択手法の前処理ステップとして機能することがある。例えば、ENNはDROP3の最初のステップであり、LSSmはLSBoによって使用される。
第3のカテゴリは、任意の近傍内で最も密度の高いインスタンスを選択し、境界点と内部点の両方を含む可能性がある。LDIS、CDIS、XLDISなどのアルゴリズムがここに該当する。LDISとCDISはシンプルで、元のデータを非常に代表するサブセットを生成する。各クラス内で代表インスタンスを個別に検索するため、時間計算量と実効実行時間の点でDROP3やICFなどのアルゴリズムよりも高速である。
プロトタイプベースのアプローチ
一部のアルゴリズムは、実際のインスタンスを選択する代わりに、合成プロトタイプを生成する。PSSA、PSDSP、PSSPは、空間分割、具体的には超直方体の概念を使用して類似インスタンスを特定し、各グループのプロトタイプを抽出する。これらのアプローチは、実際のインスタンスを選択するように適応させることもできる。アルゴリズムISDSPは同様の戦略に従うが、プロトタイプではなく実際のインスタンスを選択する。
アプリケーションとトレードオフ
インスタンス選択は、トレーニング時間とメモリ使用量が重要な関心事となる大規模データセットのシナリオで価値がある。データセットを削減することで、モデルのトレーニングを高速化し、ノイズを除去することで一般化を向上させることができる。しかし、過度な削減は有益なインスタンスを失うリスクがあり、分類性能を低下させる可能性がある。削減率と精度のバランスは、あらゆるインスタンス選択戦略を評価する上で中心となる。
他の技術との関係
インスタンス選択は、データセットを拡張するために新しい合成サンプルを生成するデータ拡張や、トレーニング後にモデルの複雑さを削減するモデルプルーニングとは異なる。また、インスタンスではなく属性の数を削減する特徴選択とも異なる。実際には、インスタンス選択は他の前処理ステップと組み合わせて、機械学習パイプライン全体を最適化することが多い。
評価と実用的な考慮事項
一般的な評価指標には、削除されたインスタンスの割合を測定する削減率と、保持されたテストセットでの分類精度が含まれる。アルゴリズムの選択は、データ分布と特定の目標(ノイズ除去か最大削減かなど)に依存する。ENNなどのアルゴリズムはノイズの多いデータセットのクリーニングに効果的であり、DROP3などの境界ベースの手法は重要な決定境界を保持することを目的としている。選択プロセス自体の計算コストも要因であり、非常に大規模なデータセットにはLDISのようなよりシンプルな方法が好まれる。
今後の方向性
研究は、特に高次元データと深層学習アプリケーション向けの、より効率的でスケーラブルなインスタンス選択手法の探求を続けている。ニューラルネットワークのトレーニングパイプラインにインスタンス選択を統合することへの関心があり、データセットを削減することで精度を大きく損なうことなくトレーニングを加速できる。データセットがサイズと複雑さの点で成長し続ける中、インスタンス選択は人工知能システムにおける計算リソース管理のための関連ツールであり続けている。