贝叶斯推断是一种统计方法,它根据新证据修正假设的概率。它基于贝叶斯定理,该定理将假设的后验概率表示为先验概率与在该假设下观测数据似然度的乘积成正比。这一框架为量化不确定性并在数据积累过程中更新信念提供了一种原则性方法。
在实践中,贝叶斯推断将未知参数视为具有概率分布的随机变量。先验分布编码了在观测数据之前的初始假设,而后验分布结合先验与似然度以反映更新后的信念。这使得领域知识能够被连贯地整合,并产生完整的概率输出,而不仅仅是点估计。
该方法是概率机器学习中的核心,它支撑着输出预测分布而非单一值的模型。它也用于医学诊断、金融和工程等领域,以在不确定性下进行决策。
数学基础
贝叶斯定理通常写作 P(H|E) = P(E|H) * P(H) / P(E),其中 H 表示假设,E 表示证据。先验 P(H) 反映初始合理性,似然度 P(E|H) 衡量在假设为真时证据出现的概率,边际似然度 P(E) 对结果进行归一化。后验 P(H|E) 表示在观测到证据后更新了的信念。
一个关键挑战是计算边际似然度,这通常涉及对参数空间进行积分。对于许多模型,该积分难以处理,因此需要近似方法。精确推断仅限于共轭先验,即后验与先验具有相同函数形式的情况,例如用于二元数据的 beta-二项模型或用于连续数据的正态-正态模型。
近似方法
当精确推断不可行时,实践者依赖近似方法。马尔可夫链蒙特卡洛(MCMC)方法,包括 Metropolis-Hastings 算法和哈密顿蒙特卡洛,从后验分布中采样。这些方法准确但计算成本高。变分推断则将问题重新表述为优化,通过最小化两个分布之间的 Kullback-Leibler 散度,用更简单的分布近似后验。这种方法更快,并能扩展到更大的数据集,使其在 Deep learning 应用中很常见。
另一类方法包括拉普拉斯近似,它围绕后验众数拟合高斯分布,以及期望传播,它迭代匹配矩。每种方法都在准确性和速度之间进行权衡,选择取决于模型复杂度和可用计算资源。
在机器学习中的作用
贝叶斯推断通过贝叶斯神经网络影响了 Machine learning,后者在网络权重上放置先验并产生预测分布。这些模型提供校准的不确定性估计,在自动驾驶和医学成像等安全关键领域很有用。高斯过程是用于回归和分类的经典贝叶斯非参数方法,提供闭式预测分布。
该框架也出现在 Generative AI 和 Large language model 研究中,其中贝叶斯方法用于模型校准和解释输出中的不确定性。贝叶斯优化等技术有助于高效调整超参数,贝叶斯模型选择使用证据来比较候选架构。
著名的学术中心推动了这一领域的发展。MIT CSAIL 和 Stanford AI Lab 在变分推断和概率编程方面产生了基础性研究。BAIR (Berkeley AI Research) 和 University of Toronto 为可扩展的贝叶斯深度学习做出了贡献。Google DeepMind 和 OpenAI 的行业研究团队将这些思想应用于稳健的模型训练和不确定性量化。
应用与技术
贝叶斯推断支撑着诸如 Reinforcement Learning from AI Feedback (RLAIF)(基于 AI 反馈的强化学习)等方法,其中对奖励的不确定性被概率性地建模。它也与 Curriculum Learning 相关,通过根据后验置信度实现自适应训练计划。在 Stochastic Gradient Descent Variants 和 Adam (Optimizer) 中,贝叶斯启发的更新规则结合了二阶信息或噪声以获得更好的泛化。
实际应用包括垃圾邮件过滤,其中朴素贝叶斯分类器是一种简单的贝叶斯模型;估计用户偏好的推荐系统;以及网络中的异常检测。在医疗保健中,贝叶斯自适应临床试验根据积累的数据调整患者分配。在机器人技术中,它通过概率传感器融合实现同时定位与地图构建(SLAM)。
尽管有其优势,贝叶斯推断可能对先验选择敏感。研究人员已开发出稳健的先验和诊断方法来缓解这一问题。可扩展性仍然是一个挑战,尽管随机变分推断的进展使其对大型数据集变得可行。近似方法持续演进,模糊了经典统计学与现代 Artificial intelligence 之间的界限。
局限性与未来方向
主要局限性是计算成本,尤其是对于高维模型。MCMC 可能较慢,而变分方法在近似过于严格时可能低估不确定性。先验指定既是优势也是风险:选择不当的先验可能使结果产生偏差。检查后验对先验的敏感性是标准做法。
未来工作集中于摊销推断,即神经网络学习快速近似后验,以及将贝叶斯思想与 Transformer (architecture) 架构集成,以在 Neural network 输出中提供校准的置信度分数。人们也越来越有兴趣将贝叶斯方法与 Data Augmentation 结合以改进后验采样,并与 Model Pruning 结合以创建稀疏、可解释的模型。随着计算成本降低,完整贝叶斯推断可能在生产系统中变得更加常规。
总体而言,贝叶斯推断仍然是概率推理的基石,为从证据中学习提供了严格的数学框架。随着各行业对可靠不确定性估计的需求日益迫切,它在 Machine learning 中的采用稳步增长。