不确定性估计

译自英文

不确定性估计量化了机器学习模型的置信度,区分了偶然不确定性(数据固有)和认知不确定性(模型知识),通常采用贝叶斯方法。

机器学习中的不确定性估计是指量化模型预测置信度的过程。它区分了偶然不确定性(源于数据固有的随机性)与认知不确定性(源于模型知识的缺乏)。这一区分对于依赖模型输出进行决策的应用至关重要,例如医学诊断、自动驾驶和金融预测。通过估计不确定性,系统可以标记低置信度的预测,触发人工审查,或相应调整其行为。

这一概念借鉴了不确定性量化(UQ)这一更广泛的领域,该领域长期以来一直用于计算科学和工程中。UQ旨在表征计算模型和真实世界实验中的不确定性,通常使用统计和概率方法。在机器学习中,随着深度学习的兴起,不确定性估计变得日益重要,因为模型往往过度自信且校准不良。技术范围从贝叶斯神经网络到集成方法和校准程序。

不确定性来源

机器学习模型中的不确定性可能源于多个来源,与传统UQ中的来源相似。参数不确定性出现在模型参数并非精确已知时,例如从有限数据中估计的神经网络权重。参数性不确定性源于输入变量的变异性,如感知任务中的传感器噪声。结构性不确定性,也称为模型不充分性,发生在模型架构或假设未能完美捕捉真实潜在函数时。算法性不确定性源于训练或推理中的数值近似,如随机梯度下降或有限精度算术。实验性不确定性反映了训练数据标签中的噪声,而插值不确定性则出现在对远离训练分布的输入进行预测时。

偶然不确定性 vs. 认知不确定性

机器学习中最常见的分类法将不确定性分为两类。偶然不确定性,源自拉丁语“alea”(骰子),是数据中固有的不可约简的随机性。例如,在图像分类中,两张相同的图像可能因标签错误或内容模糊而有不同的标签。这种不确定性无法通过收集更多数据来减少。认知不确定性,源自希腊语“episteme”(知识),是由于对模型或数据缺乏了解而产生的可约简不确定性。它可以通过收集更多训练数据、改进模型架构或使用更好的推理方法来减少。在实践中,这两种类型往往共存,而分离它们是不确定性估计的一个关键目标。

贝叶斯方法

贝叶斯推理为认知不确定性估计提供了一个原则性框架。在贝叶斯神经网络中,不是学习一组单一的权重,而是根据训练数据计算权重的后验分布。这个后验分布捕捉了参数不确定性,预测是通过对该分布进行积分来进行的。然而,对于现代深度网络,精确的贝叶斯推理是不可行的,因此使用近似方法。变分推理用更简单的分布来近似后验,而马尔可夫链蒙特卡洛(MCMC)方法则从后验中采样。Dropout,一种常见的正则化技术,可以被解释为一种贝叶斯近似,正如Yarin Gal在2016年所展示的,这使得无需架构更改即可从现有模型中获得不确定性估计。

集成方法

集成方法提供了一种实用的替代显式贝叶斯推理的方法。通过训练多个具有不同初始化或数据子集的模型,它们预测之间的方差提供了认知不确定性的估计。深度集成,由Balaji Lakshminarayanan等人于2017年提出,已被证明能产生校准良好的不确定性估计,并优于单一模型。集成成员预测的分布范围指示了不确定性,而平均预测则作为最终输出。集成方法因其简单性和有效性而在实践中被广泛使用,尽管它们需要额外的计算成本。

校准与评估

不确定性估计只有在校准良好的情况下才有用,这意味着预测概率为0.8的事件应有80%的时间是正确的。校准通常使用可靠性图和期望校准误差(ECE)等指标来衡量。现代神经网络往往校准不良,尤其是在使用交叉熵损失和批归一化等技术训练时。温度缩放,一种事后校准方法,调整softmax温度以改善校准而不改变准确性。其他方法包括Platt缩放和等渗回归。评估不确定性估计还涉及诸如Brier分数、负对数似然和置信区间覆盖率等指标。

深度学习中的应用

不确定性估计在安全关键应用中至关重要。在自动驾驶中,像WaymoTesla Autopilot这样的系统使用不确定性来决定何时依赖传感器数据或请求人工干预。在医学成像中,不确定性帮助放射科医生优先处理需要审查的病例。在自然语言处理中,诸如来自OpenAIAnthropic的大型语言模型可以在其响应中表达不确定性,尽管校准仍然是一个挑战。不确定性在主动学习中也发挥作用,模型选择最不确定的样本进行标注,以及在强化学习中,它指导探索。

挑战与未来方向

尽管取得了进展,深度学习中的不确定性估计仍面临若干挑战。可扩展性是一个主要问题,因为贝叶斯方法和集成方法计算成本高昂。对抗性示例可以欺骗不确定性估计,使其过度自信。分布偏移,即测试数据与训练数据不同,特别难以检测。研究正在探索混合方法,例如将集成方法与贝叶斯近似相结合,以及在模型选择和决策制定中使用不确定性。随着模型在更多关键领域部署,稳健的不确定性估计将变得越来越重要。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:uncertainty-estimation·machine-learning·bayesian-methods·calibration
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史