核正则化的贝叶斯解释是机器学习中的一个概念框架,它通过贝叶斯推断的视角来审视基于核的学习方法,如支持向量机和高斯过程回归。在这种观点下,核函数的选择编码了关于可能函数的先验概率分布,而正则化参数则充当一个超参数,控制该先验相对于观测数据的强度。由此产生的学习算法生成后验分布,其中正则化解通常对应于最大后验(MAP)估计。
这一解释为理解正则化为何能改善泛化提供了原则性方法:它体现了一种先验信念,即真实潜在函数是平滑的或具有有限复杂度。通过显式建模不确定性,贝叶斯视角还提供了超参数选择的工具,如边际似然最大化,以及量化预测不确定性的手段,这在主动学习和不确定性下的决策等应用中具有重要价值。
数学表述
在核岭回归中,目标是最小化正则化损失:$\sum_{i=1}^n (y_i - f(x_i))^2 + \lambda \|f\|_{\mathcal{H}}^2$,其中$\mathcal{H}$是带有核$k$的再生核希尔伯特空间(RKHS),且$\lambda > 0$是正则化参数。从贝叶斯角度看,这可以通过在$f$上放置一个均值为零、协方差函数为$k(x, x')$的高斯过程先验来推导。假设噪声服从方差为$\sigma^2$的高斯分布,则函数上的后验分布也是高斯过程,其均值函数正是当$\lambda = \sigma^2 / \tau^2$时正则化最小二乘问题的解,其中$\tau^2$是先验方差尺度。
这一等价性在1990年代由包括克里斯托弗·毕晓普在内的研究者正式化,他们表明正则化项对应于先验密度的负对数,而损失对应于负对数似然。这种对偶性使从业者能够在算法解释和概率解释之间无缝切换。
核作为先验的角色
核函数$k(x, x')$定义了先验的协方差结构,这决定了所考虑函数的平滑性和平稳性属性。例如,径向基函数(RBF)核$k(x, x') = \exp(-\|x - x'\|^2 / (2\ell^2))$,其中长度尺度为$\ell$,编码了一个偏好于在小于$\ell$的距离上缓慢变化函数的先验。相比之下,线性核$k(x, x') = x \cdot x'$对应于线性函数上的先验,而$d$次多项式核则限制为至多$d$次的多项式。
这一解释澄清了核的选择不仅仅是计算上的便利,而是一个实质性的建模决策。它还推动了自动相关性确定(ARD)核的使用,其中每个输入维度都有自己的长度尺度,使先验能够适应不同特征的相关性。此类核广泛用于高斯过程回归和分类模型中。
与高斯过程的联系
高斯过程(GPs)是核方法的经典贝叶斯处理方式。在GP中,函数上的先验由均值函数(通常为零)和协方差函数(即核)完全指定。给定训练数据后,后验通过解析方式计算,产生预测均值和预测方差。预测均值与核岭回归解一致,而方差提供了纯频率派设置中不可用的不确定性估计。
这一联系具有实际意义。例如,在贝叶斯优化和主动学习中,预测方差指导新数据点的选择。此外,边际似然(即对函数值进行积分)可用于通过最大化对数边际似然来调整核超参数(如长度尺度和噪声方差)。这是交叉验证的一种原则性替代方案,尽管对于大型数据集而言计算成本更高。
正则化参数作为先验强度
核方法中的正则化参数$\lambda$直接映射到噪声方差与先验方差的比率。较大的$\lambda$对应于强先验(或高噪声),导致更平滑的函数和更多向先验均值的收缩。较小的$\lambda$允许模型更紧密地拟合数据,从而有过度拟合的风险。在贝叶斯框架中,$\lambda$不是一个自由的调节旋钮,而是假设的噪声水平和先验尺度的结果,可以通过边际似然从数据中估计。
这一视角还解释了正则化在极限情况下的行为。当$\lambda \to 0$时,解趋近于精确拟合所有训练点的插值函数,这通常是不理想的。当$\lambda \to \infty$时,解坍缩为先验均值(通常为零)。最优的$\lambda$在偏差和方差之间取得平衡,而贝叶斯框架提供了一种无需网格搜索即可找到它的原则性方法。
应用与扩展
贝叶斯解释已扩展到各种基于核的模型。在支持向量机中,铰链损失不对应于标准高斯似然,但可以通过拉普拉斯近似或将SVM视为特定先验下的MAP估计来获得概率解释。更一般地,该框架支撑了相关向量机,后者使用稀疏贝叶斯学习方法选择训练点的子集作为相关向量。
在现代深度学习中,核正则化的贝叶斯观点影响了无限宽神经网络的研究,这些网络收敛到高斯过程(即神经网络高斯过程,或NNGP)。这一联系由雅各布·斯坦哈特等研究者探索,弥合了核方法与神经网络之间的鸿沟,使贝叶斯推断的见解能够为架构设计和训练提供信息。此外,这一概念是高斯过程回归在概率机器学习中的核心内容,并在克里斯托弗·毕晓普和卡尔·拉斯穆森等标准教科书中有所讲授。
局限性与批评
尽管其优雅性,贝叶斯解释存在局限性。函数上的先验通常是为了计算便利而非真正的先验知识而选择,这可能导致模型设定错误。高斯噪声假设在实践中可能被违反,且边际似然可能对核和超参数的选择敏感。此外,对于大型数据集,GP中的精确贝叶斯推断随训练点数量呈三次方扩展,因此需要稀疏GP或诱导点方法等近似手段。
批评者还指出,核岭回归计算的MAP估计并未完全捕捉后验不确定性,且贝叶斯论证并不自动保证比频率派替代方案更好的预测性能。尽管如此,这一解释仍然是理解正则化和开发新算法的强大概念工具。