カーネル正則化のベイズ的解釈は、機械学習における概念的枠組みであり、サポートベクターマシンやガウス過程回帰などのカーネルベースの学習手法を、ベイズ推論の観点から捉えるものである。この見方では、カーネル関数の選択が可能な関数上の事前確率分布を符号化し、正則化パラメータは観測データに対するこの事前分布の強さを制御するハイパーパラメータとして機能する。結果として得られる学習アルゴリズムは事後分布を生成し、正則化された解はしばしば最大事後確率(MAP)推定に対応する。
この解釈は、正則化がなぜ汎化を改善するのかを原理的に理解する手段を提供する。それは、真の基礎となる関数が滑らかであるか、または限られた複雑さを持つという事前の信念を具現化する。不確実性を明示的にモデル化することで、ベイズ的視点は限界尤度の最大化などのハイパーパラメータ選択のためのツールや、予測的不確実性を定量化するためのツールも提供し、これは能動学習や不確実性下での意思決定などの応用において価値がある。
数学的定式化
カーネルリッジ回帰では、正則化された損失を最小化することが目的である: $\sum_{i=1}^n (y_i - f(x_i))^2 + \lambda \|f\|_{\mathcal{H}}^2$。ここで $\mathcal{H}$ はカーネル $k$ を持つ再生核ヒルベルト空間(RKHS)であり、$\lambda > 0$ は正則化パラメータである。ベイズ的観点からは、これは $f$ に平均ゼロで共分散関数 $k(x, x')$ を持つガウス過程事前分布を置くことで導出できる。分散 $\sigma^2$ のガウスノイズを仮定すると、関数上の事後分布もガウス過程となり、その平均関数は $\lambda = \sigma^2 / \tau^2$ のときの正則化最小二乗問題の解と正確に一致する。ここで $\tau^2$ は事前分散のスケールである。
この等価性は1990年代にクリストファー・ビショップなどの研究者によって形式化され、正則化項が事前密度の負の対数に対応し、損失が負の対数尤度に対応することが示された。この双対性により、実践者はアルゴリズム的解釈と確率的解釈をシームレスに切り替えることができる。
事前分布としてのカーネルの役割
カーネル関数 $k(x, x')$ は事前分布の共分散構造を定義し、これが考慮される関数の滑らかさや定常性の特性を決定する。例えば、長さスケール $\ell$ を持つ動径基底関数(RBF)カーネル $k(x, x') = \exp(-\|x - x'\|^2 / (2\ell^2))$ は、$\ell$ より小さい距離でゆっくり変化する関数を好む事前分布を符号化する。対照的に、線形カーネル $k(x, x') = x \cdot x'$ は線形関数上の事前分布に対応し、次数 $d$ の多項式カーネルは最大次数 $d$ の多項式に制限する。
この解釈は、カーネルの選択が単なる計算上の便宜ではなく、実質的なモデリング上の決定であることを明確にする。また、各入力次元が独自の長さスケールを持つ自動関連性決定(ARD)カーネルの使用を動機付け、事前分布が異なる特徴の関連性に適応することを可能にする。このようなカーネルは、回帰および分類のためのガウス過程モデルで広く使用されている。
ガウス過程との関連
ガウス過程(GP)はカーネル法の標準的なベイズ的扱いである。GPでは、関数上の事前分布は平均関数(しばしばゼロ)と共分散関数(カーネル)によって完全に指定される。トレーニングデータが与えられると、事後分布は解析的に計算され、予測平均と予測分散の両方が得られる。予測平均はカーネルリッジ回帰の解と一致し、分散は純粋に頻度論的な設定では利用できない不確実性の推定を提供する。
この関連には実用的な含意がある。例えば、ベイズ最適化や能動学習では、予測分散が新しいデータ点の選択を導く。さらに、関数値を積分消去する限界尤度は、対数限界尤度を最大化することによってカーネルのハイパーパラメータ(長さスケールやノイズ分散など)を調整するために使用できる。これは交差検証に代わる原理的な方法であるが、大規模データセットでは計算コストが高くなる。
事前強度としての正則化パラメータ
カーネル法における正則化パラメータ $\lambda$ は、ノイズ分散と事前分散の比に直接対応する。大きな $\lambda$ は強い事前分布(または高いノイズ)に対応し、より滑らかな関数と事前平均へのより強い縮小をもたらす。小さな $\lambda$ はモデルがデータにより密接に適合することを可能にし、過学習のリスクを伴う。ベイズ的枠組みでは、$\lambda$ は自由な調整ノブではなく、仮定されたノイズレベルと事前スケールの結果であり、限界尤度を介してデータから推定できる。
この視点はまた、極限における正則化の挙動を説明する。$\lambda \to 0$ のとき、解はすべてのトレーニング点を正確に適合する補間関数に近づき、これはしばしば望ましくない。$\lambda \to \infty$ のとき、解は事前平均(通常はゼロ)に崩壊する。最適な $\lambda$ はバイアスと分散のバランスを取り、ベイズ的枠組みはグリッド探索に頼らずにそれを見つける原理的な方法を提供する。
応用と拡張
ベイズ的解釈は様々なカーネルベースのモデルに拡張されている。サポートベクターマシンでは、ヒンジ損失は標準的なガウス尤度に対応しないが、ラプラス近似を使用するか、SVMを特定の事前分布下でのMAP推定として扱うことによって確率的解釈を得ることができる。より一般的には、この枠組みは関連ベクターマシンの基礎となっており、これはスパースベイズ学習アプローチを使用してトレーニング点のサブセットを関連ベクトルとして選択する。
現代の深層学習では、カーネル正則化のベイズ的視点が無限幅ニューラルネットワークの研究に影響を与えており、これらはガウス過程(ニューラルネットワークガウス過程、またはNNGP)に収束する。この関連は、ジェイコブ・スタインハートなどの研究者によって探求され、カーネル法とニューラルネットワークを橋渡しし、ベイズ推論からの洞察がアーキテクチャ設計とトレーニングに情報を提供することを可能にする。さらに、この概念はガウス過程回帰の中心であり、確率的機械学習において重要であり、クリストファー・ビショップやカール・ラスムッセンによる標準的な教科書で教えられている。
限界と批判
その優雅さにもかかわらず、ベイズ的解釈には限界がある。関数上の事前分布は、真の事前知識よりも計算上の便宜のために選ばれることが多く、これは誤特定されたモデルにつながる可能性がある。ガウスノイズの仮定は実際には違反される可能性があり、限界尤度はカーネルとハイパーパラメータの選択に敏感であり得る。さらに、大規模データセットでは、GPにおける正確なベイズ推論はトレーニング点の数に対して3乗のスケーリングを持ち、スパースGPや誘導点法などの近似が必要となる。
批判者はまた、カーネルリッジ回帰が計算するMAP推定が事後不確実性を完全に捉えておらず、ベイズ的正当化が頻度論的代替案よりも優れた予測性能を自動的に保証するものではないと指摘する。それにもかかわらず、この解釈は正則化を理解し、新しいアルゴリズムを開発するための強力な概念的ツールであり続けている。