データセットシフトは、機械学習と人工知能における根本的な問題であり、展開時のデータの統計的分布が訓練データの分布と異なる状況を指す。この不一致は、モデルが元のデータセットで高い精度で訓練されていたとしても、モデルの性能に重大な低下をもたらす可能性がある。この現象は分布シフトまたは非定常性としても知られ、データが時間とともに進化する、または訓練環境とは異なるソースから生じる実世界のアプリケーションにおいて主要な関心事である。
データセットシフトは、過学習やデータ不足などの他のエラー要因とは区別される。過学習はモデルが訓練セット内のノイズを捕捉することに関連する一方、データセットシフトは訓練分布とテスト分布の間の乖離に特に対処する。実際には、データセットシフトは、特に金融、医療、自動運転などの動的環境に展開される深層学習システムにおいて、本番環境でのモデル障害の主要な原因となることが多い。
データセットシフトの種類
データセットシフトは、一般的に3つの主要なタイプに分類され、それぞれ異なる原因と影響を持つ。共変量シフトは、入力特徴量の分布が訓練と展開の間で変化するが、入力と出力の間の条件付き関係は同じままである場合に発生する。例えば、昼間の交通画像で訓練されたモデルが、展開時に夜間の画像に遭遇する場合、ピクセルから物体への基礎となるマッピングを変更することなく、特徴量分布が変化する。
ラベルシフト(または事前確率シフト)は、出力ラベルの分布が変化する一方で、ラベルが与えられた場合の特徴量の条件付き分布が一定に保たれる場合に発生する。これは、人口における疾患の有病率が時間とともに変化するが、疾患に関連する症状は一貫している医療診断において一般的である。
コンセプトドリフトは、入力と出力の間の条件付き関係自体の変化を指す。これは、株価を予測する要因が時間とともに変化する金融市場や、スパマーが戦術を適応させるスパム検出においてよく見られる。コンセプトドリフトは、変化の時間的パターンに応じて、突然、漸進的、反復的ドリフトにさらに分類できる。
原因と検出
データセットシフトは複数の原因から生じる。サンプル選択バイアスは、訓練データが非ランダムに収集された場合に発生し、例えば、対象母集団を代表しない便宜的サンプルを使用する場合などがある。非定常環境は、季節的な消費者行動や大規模言語モデルの訓練コーパスにおける言語使用の進化など、基礎となるデータ生成プロセスが進化するときにシフトを引き起こす。ドメイン適応のシナリオ、つまり1つのドメイン(例:合成画像)で訓練されたモデルが別のドメイン(例:実写写真)に適用される場合も、シフトを生じさせる。
データセットシフトの検出は活発な研究分野である。コルモゴロフ-スミルノフ検定などの統計的検定は、訓練データと展開データの間の特徴量分布を比較できる。より洗練されたアプローチでは、密度比推定を使用し、訓練サンプルとテストサンプルを区別するように分類器を訓練する。本番システムでは、予測信頼度とエラー率を時間とともに監視することが、シフトの間接的な指標として機能する。母集団安定性指数(PSI)などのツールは、信用スコアリングにおいて特徴量分布のシフトを定量化するために広く使用されている。
緩和戦略
いくつかの技術がデータセットシフトに対処する。重要度重み付けは、テスト分布により適合するように訓練サンプルを再重み付けし、共変量シフトに一般的に使用される。ドメイン適応の方法、敵対的訓練や特徴量アライメントを含む、はドメイン間で堅牢な不変表現を学習する。コンセプトドリフトに対しては、オンライン学習アルゴリズムが新しいデータでモデルを継続的に更新し、アンサンブル法(ストリーミングランダムフォレストなど)は古いモデルを破棄することで適応できる。
データ拡張は、訓練分布を人工的に拡張して妥当な変動をカバーする積極的なアプローチであり、コンピュータビジョンでは回転や色のジッターで使用される。ニューラルネットワークの訓練では、バッチ正規化などの技術が内部共変量シフトを安定化させるのに役立つが、これは関連するが異なる概念である。ラベルシフトに対しては、事後補正法が推定されたラベル事前分布に基づいて予測確率を調整する。
評価と研究
データセットシフトに対するモデルの堅牢性を評価するには、専用のベンチマークが必要である。ImageNet-Cデータセットは、一般的な破損を適用して堅牢性をテストし、WILDSは野生生物のモニタリングや病理組織学などの実世界設定における分布シフトのためのベンチマークスイートである。スタンフォードAIラボやバークレーAI研究などの機関での研究は、シフト検出と適応に関する基礎的な成果を生み出しており、アレクサンダー・マドリーによる敵対的堅牢性やアニマ・アナンドクマールによるドメイン一般化への顕著な貢献がある。
生成AIとトランスフォーマーモデルの文脈では、データセットシフトは訓練コーパスにおける分布ドリフトとして現れ、時間とともにモデルの挙動に影響を与える。例えば、2020年のウェブテキストで訓練された大規模言語モデルは、2023年以降の出来事に関するクエリでは性能が低下する可能性がある。これは、継続学習とモデル更新への研究を動機付けており、OpenAIやGoogle DeepMindなどの企業は、時間的シフトを緩和する技術に投資している。
実用的影響
産業界では、データセットシフトは重要な運用上の関心事である。金融機関は、経済サイクルによるシフトに対して信用モデルを監視する必要があり、バーゼル合意などの規制枠組みによって義務付けられている。医療AIシステムは、医用画像機器の変更や患者人口統計の変化によるシフトに直面する。ウェイモやテスラ・オートパイロットなどの自動運転企業は、道路状況や標識が異なる新しい地理的領域に展開する際にシフトに遭遇する。
ベストプラクティスには、ベースライン性能指標の確立、継続的な監視パイプラインの実装、組み込みの適応性を備えたモデルの設計が含まれる。モデルメンテナンスの分野が出現し、展開されたシステムにおけるシフトを検出、診断、修正する体系的なアプローチに焦点を当てている。2020年代半ばの時点で、データセットシフトは依然として未解決の課題であり、普遍的な解決策はないが、研究コミュニティからは方法のツールキットとより深い理論的理解が成長している。
将来の方向性
新興のアプローチは、メタ学習と基盤モデルを活用して、よりシフト耐性のあるシステムを構築する。テスト時訓練は、ラベルなしの展開データを使用してモデルをその場で適応させ、因果推論の方法は、環境間で不変な安定したメカニズムを特定することを目的とする。不確実性定量化の統合、モデルが信頼区間を出力することで、実務者はシフト下で予測を信頼すべきタイミングを知ることができる。AIシステムがより普及するにつれて、データセットシフトへの対処は、信頼性が高く安全な展開に不可欠となるだろう。