機械学習におけるキャリブレーションとは、モデルが予測する確率が、実際に観測される事象の頻度とどの程度一致しているかを指す。完全にキャリブレーションされたモデルとは、例えば信頼度0.8と割り当てられたすべての予測について、その事象が80%のケースで発生するモデルである。この特性は正確性とは異なる。モデルは高い正確性を持ちながらキャリブレーションが不十分である場合も、その逆の場合もある。キャリブレーションは、確率的出力を意思決定、リスク評価、不確実性の伝達に使用するあらゆるシステムにとって重要な品質指標であり、特に医学、金融、自動運転などの分野で重要である。
この概念は統計学と気象学に深いルーツを持ち、確率的予測は長年にわたり標準的な実践となっている。Machine learningの文脈では、モデルが単純なクラスラベルを生成するから確率推定値を生成するへと移行するにつれて、特にDeep learningとNeural networkアーキテクチャの台頭とともに、キャリブレーションが注目を集めるようになった。現代のLarge language modelやその他の生成システムもキャリブレーションの課題に直面しており、そのトークンレベルの確率は、事実的正確性やユーザー満足度の真の可能性を反映していないことが多い。
キャリブレーション曲線と指標
キャリブレーションを可視化する主要なツールは、信頼度ダイアグラム(キャリブレーション曲線とも呼ばれる)である。このプロットは、予測を信頼度に基づいてビンに分割し(例:0.0-0.1、0.1-0.2、...)、各ビン内の平均予測確率を陽性結果の経験的頻度に対してプロットする。完全にキャリブレーションされたモデルは、(0,0)から(1,1)への対角線を生成する。この対角線からの逸脱は、過信(予測確率が実際の頻度を上回る線の下の点)または過小信頼(線の上の点)を示す。
いくつかのスカラー指標がキャリブレーション誤差を定量化する。最も一般的なのは期待キャリブレーション誤差(ECE)であり、ビン全体での正確性と信頼度の絶対差の加重平均を計算する。関連する指標である最大キャリブレーション誤差(MCE)は、最悪ケースのビン偏差に焦点を当てており、単一の過信予測が壊滅的であり得る安全重視のアプリケーションに特に関連する。もう一つの指標であるブライアスコアは、キャリブレーションとリファインメントの成分に分解され、確率的予報品質の包括的な評価を提供する。
キャリブレーション不良の原因
キャリブレーション不良は、現代の機械学習に固有のいくつかの原因から生じる。過剰パラメータ化されたモデル(深層ニューラルネットワークなど)は、トレーニングデータを記憶しノイズに適合できるため過信する傾向があり、予測確率が極端になりすぎる。クロスエントロピーのような損失関数の使用は、出力が0または1に近づくことを促進し、この効果を悪化させる。さらに、Data Augmentation技術とBatch Normalizationはロジットの分布を歪め、キャリブレーションをさらに悪化させる可能性がある。
もう一つの重要な原因は分布シフトである。トレーニング分布でキャリブレーションされたモデルは、異なる分布のデータに展開されるとキャリブレーション不良になる可能性があり、これは実世界のアプリケーションで一般的なシナリオである。例えば、過去の金融データでトレーニングされたモデルは、市場のレジームチェンジ中にキャリブレーションが不十分になる可能性がある。モデルアーキテクチャの複雑さも役割を果たし、Residual Network (ResNet)やTransformer (architecture)ベースのモデルは、より単純なアーキテクチャとは異なるキャリブレーション特性を示すことが多い。
キャリブレーション手法
キャリブレーションを改善するために、ポストホックおよびトレーニング時のさまざまな手法が開発されている。最も広く使用されているポストホック技術はTemperature Scalingであり、ソフトマックス関数を適用する前にロジットを分割する単一のスカラーパラメータTを導入する。このパラメータは、負の対数尤度を最小化するために検証セットで最適化される。温度スケーリングはシンプルで効果的であり、モデルの予測クラスを変更せず、その信頼度のみを変更する。これはキャリブレーション研究における標準的なベースラインとなっている。
他のポストホック手法には、ロジットにロジスティック回帰モデルを適合させるプラットスケーリングや、予測確率から経験的頻度への単調マッピングを学習するノンパラメトリックアプローチである等張回帰が含まれる。これらの手法は温度スケーリングよりも柔軟であるが、より多くのデータを必要とし、正則化されないと過適合する可能性がある。多クラス問題では、行列スケーリングとベクトルスケーリングが、ロジットベクトルの完全または対角変換を学習することでこれらのアイデアを拡張する。
トレーニング時のアプローチは、キャリブレーションを学習プロセスに統合する。そのような手法の一つがラベルスムージングであり、ハードな0/1ラベルをソフトターゲットに置き換え、モデルが過度に自信過剰になるのを防ぐ。もう一つはフォーカル損失であり、よく分類された例の重みを下げ、モデルがより難しいケースに焦点を当てることを促し、より良いキャリブレーションされた確率を生成する。重み減衰やDropoutのような正則化技術も、過適合を減らすことで間接的にキャリブレーションを改善する。
大規模言語モデルにおけるキャリブレーション
Large language modelは独自のキャリブレーション課題を提示する。これらのモデルはトークンごとにテキストを生成し、個々のトークンに割り当てられた確率は、生成された応答の事実的正確性に対する信頼度に直接対応しない。例えば、モデルは一貫しているが事実的に誤ったステートメントを形成するトークンシーケンスに高い確率を割り当てる可能性がある。この現象はしばしば「幻覚」と呼ばれ、キャリブレーション不良と密接に関連している。
研究者は、モデルに自然言語でその信頼度を表現させる(例:「90%確信しています」)そしてこれらの言語化された信頼度を経験的精度にマッピングするなど、LLMをキャリブレーションするさまざまな方法を探求してきた。他のアプローチには、キャリブレーション目的でのファインチューニングや、より信頼性の高い不確実性推定を得るためのモデルアンサンブルの使用が含まれる。しかし、トークン確率と意味的正確性の関係は複雑で完全には理解されていないため、LLMにおけるキャリブレーションは依然として未解決の研究課題である。
応用と重要性
キャリブレーションは、モデルの信頼度に基づいて意思決定が行われる高リスク領域で重要である。医療診断では、疾患の90%の確率を予測するモデルは90%のケースで正しくなければならず、そうでなければ臨床医を誤解させる可能性がある。自動運転では、障害物の存在について過信する認識システムは不十分なブレーキングにつながる可能性がある。金融では、キャリブレーションされた確率推定はリスク管理とポートフォリオ最適化に不可欠である。
強化学習と逐次的意思決定では、価値推定と行動確率のキャリブレーションは探索と活用のトレードオフに影響を与える。アクティブラーニングでは、モデルがどのデータポイントをラベル付けするかを選択する際に、キャリブレーションされた不確実性推定が最も情報量の多い例を特定するために使用される。同様に、Model Pruningとモデル圧縮では、キャリブレーションはモデルサイズを削減した後も信頼性の高い信頼度推定を維持するのに役立つ。
他の概念との関係
キャリブレーションは、他の不確実性定量化概念と密接に関連しているが、それらとは異なる。Aleatoric不確実性はデータの固有のランダム性を指し、epistemic不確実性はモデルパラメータに関する知識の欠如から生じる。キャリブレーションは、両方のタイプの不確実性を組み合わせた全体的な予測分布の特性である。モデルは、これらの不確実性源を別々に分解しなくても、よくキャリブレーションされている可能性がある。
キャリブレーションは公平性とロバスト性とも相互作用する。全体的にキャリブレーションされたモデルは、特定のサブグループに対してキャリブレーション不良である可能性があり、偏った意思決定につながる。例えば、顔認識システムはある人口統計グループに対してはキャリブレーションされているが、別のグループに対しては過信している可能性がある。サブグループ間でのキャリブレーションを確保することは、しばしば「グループキャリブレーション」と呼ばれる活発な研究分野である。
評価とベストプラクティス
実際には、キャリブレーションを評価するには、展開分布を代表する保持データセットが必要である。実践者は、正確性とともにキャリブレーションメトリクスを報告すべきであり、両方がモデル品質にとって重要である。モデルを展開する際には、温度スケーリングのようなポストホックキャリブレーション手法を適用することをお勧めする。これらは計算コストが低く、新しいデータが到着するにつれて更新できるからである。
キャリブレーションは静的な特性ではないことに注意することも重要である。データ分布がシフトするにつれて、モデルは時間の経過とともにキャリブレーション不良になる可能性があるため、継続的なモニタリングが必要である。キャリブレーションパラメータがリアルタイムで更新されるオンラインキャリブレーションのような技術は、動的な環境で信頼性を維持するのに役立つ。
将来の方向性
キャリブレーションに関する研究は進化し続けており、最近の研究はシーケンスやグラフなどの構造化出力のキャリブレーションや、データが複数のデバイスに分散しているフェデレーテッドラーニング設定でのキャリブレーションに焦点を当てている。分布シフトにロバストで、非常に大きなモデルにスケールするキャリブレーション手法の開発は、依然として未解決の課題である。Artificial intelligenceシステムが社会にますます統合されるにつれて、よくキャリブレーションされた不確実性推定の重要性はますます高まり、キャリブレーションは機械学習の基本的な研究分野となるだろう。
参考文献とさらなる読書
包括的な入門には、Chuan Guoらによる画期的な論文「On Calibration of Modern Neural Networks」(2017年)が詳細な分析を提供し、温度スケーリングを紹介している。Ali Rahimiと同僚による「Calibration and Sharpness」の研究は理論的洞察を提供する。実践的なガイダンスについては、scikit-learnの確率キャリブレーションに関するドキュメントが有用なリソースである。この分野は新しい方法と洞察を生み出し続けており、最新の文献を把握することは実践者にとって不可欠である。
結論
キャリブレーションは確率的機械学習モデルの基本的な特性であり、信頼度スコアが信頼できることを保証する。それは正確性とは異なり、測定と改善のための専用の方法を必要とする。単純なポストホックスケーリングから複雑なトレーニング時の目的まで、良いキャリブレーションを達成するための幅広い技術が存在する。モデルが能力と展開の面で成長するにつれて、信頼性の高い不確実性推定の追求は、責任あるAI開発の基礎であり続ける。