数学基础
贝叶斯定理通常写作 P(H|E) = P(E|H) * P(H) / P(E),其中 H 表示假设,E 表示证据。先验概率 P(H) 反映初始可信度,似然函数 P(E|H) 衡量在假设为真的情况下证据出现的概率,边际似然 P(E) 用于归一化结果。后验概率 P(H|E) 表示观察到证据后更新了的信念。
一个关键挑战是计算边际似然,这通常涉及对参数空间进行积分。对于许多模型,该积分难以处理,因此需要近似方法。精确推断仅限于共轭先验的情况,即后验与先验具有相同函数形式,例如二项数据模型中的贝塔-二项分布,或连续数据模型中的正态-正态分布。
近似方法
当精确推断不可行时,实践者依赖近似方法。马尔可夫链蒙特卡洛(MCMC)方法,包括 Metropolis-Hastings 算法和哈密顿蒙特卡洛,从后验分布中采样。这些方法准确但计算成本高。变分推断则将问题重新表述为优化问题,通过最小化近似分布与后验之间的 Kullback-Leibler 散度,用更简单的分布逼近后验。这种方法速度更快,可扩展到更大数据集,因此在 Deep learning 应用中很常见。
另一类方法包括拉普拉斯近似,它在后验众数附近拟合高斯分布,以及期望传播,它迭代匹配矩。每种方法都在精度和速度之间权衡,选择取决于模型复杂度和可用计算资源。
在机器学习中的作用
贝叶斯推断通过贝叶斯神经网络影响了 Machine learning,这类网络对网络权重设置先验,并产生预测分布。这些模型提供校准的不确定性估计,在安全关键领域(如自动驾驶和医学影像)中很有用。高斯过程是经典的贝叶斯非参数方法,用于回归和分类,提供闭式预测分布。
该框架也出现在 Generative AI 和 Large language model 研究中,贝叶斯方法用于模型校准和解释输出中的不确定性。贝叶斯优化等技术有助于高效调整超参数,贝叶斯模型选择使用证据来比较候选架构。
知名学术中心推动了该领域的发展。MIT CSAIL 和 Stanford AI Lab 在变分推断和概率编程方面做出了基础性研究。BAIR (Berkeley AI Research) 和 University of Toronto 为可扩展贝叶斯深度学习做出了贡献。Google DeepMind 和 OpenAI 的工业研究团队将这些思想应用于鲁棒模型训练和不确定性量化。
应用与技术
贝叶斯推断支撑着诸如 Reinforcement Learning from AI Feedback (RLAIF)(基于 AI 反馈的强化学习)等方法,其中对奖励的不确定性进行概率建模。它还与 Curriculum Learning 相关,通过后验置信度实现自适应训练计划。在 Stochastic Gradient Descent Variants 和 Adam (Optimizer) 中,受贝叶斯启发的更新规则融入了二阶信息或噪声,以改善泛化。
实际应用包括垃圾邮件过滤,其中朴素贝叶斯分类器是简单的贝叶斯模型;推荐系统,估计用户偏好;以及网络中的异常检测。在医疗保健领域,贝叶斯自适应临床试验根据累积数据调整患者分配。在机器人技术中,它通过概率传感器融合实现同步定位与地图构建(SLAM)。
尽管贝叶斯推断有诸多优势,但它对先验选择可能敏感。研究人员开发了稳健先验和诊断方法来缓解这一问题。可扩展性仍是一个挑战,尽管随机变分推断的进展使其适用于大型数据集。近似方法不断发展,模糊了经典统计学与现代 Artificial intelligence 之间的界限。
局限性与未来方向
主要局限性在于计算成本,尤其是高维模型。MCMC 可能较慢,而变分方法在近似过于严格时可能低估不确定性。先验设定既是优势也是风险:选择不当的先验可能导致结果偏差。检查后验对先验的敏感性是标准做法。
未来工作聚焦于摊销推断,即用神经网络快速逼近后验,以及将贝叶斯思想与 Transformer (architecture) 架构结合,为 Neural network 输出提供校准的置信度分数。人们也越来越感兴趣将贝叶斯方法与 Data Augmentation 结合以改进后验采样,以及与 Model Pruning 结合以创建稀疏、可解释的模型。随着计算成本降低,完整的贝叶斯推断可能在生产系统中变得更加普遍。
总体而言,贝叶斯推断仍是概率推理的基石,为从证据中学习提供了严谨的数学框架。随着对可靠不确定性估计的需求日益增长,它在 Machine learning 中的应用持续稳步扩展。