不确定性量化(UQ)是对计算和现实应用中不确定性的定量表征与估计的科学。其目标是确定,当系统的某些方面并非精确已知时,某些结果出现的可能性有多大。例如,预测人体在正面碰撞另一辆车时的加速度就涉及不确定性:即使速度精确已知,制造工艺、螺栓紧固程度等方面的微小差异也会导致不同结果,而这些结果只能以统计意义进行预测。自然科学和工程领域的许多问题都充斥着不确定性来源,而基于模拟的计算机实验是研究UQ最常用的方法。
随着机器学习和人工智能的兴起,UQ变得越来越重要,因为模型通常提供预测,却缺乏内在的置信度度量。在这些背景下,UQ有助于量化模型可靠性,支持在医疗保健、自动驾驶和金融等高风险领域更安全地部署。
不确定性来源
不确定性可以以多种方式进入数学模型和实验测量。一种分类方式区分了以下几种来源:
- 参数不确定性:源于作为计算机模型输入但其精确值未知或在物理实验中无法控制的模型参数。示例包括落体实验中的局部自由落体加速度、有限元分析中的材料属性,以及宏观经济政策优化中的乘数不确定性。
- 参数变异性:来自输入变量的变异性。例如,制造工件的尺寸可能偏离设计规格,导致性能变异性。
- 结构不确定性:也称为模型不充分性、模型偏差或模型差异,源于对底层物理机制认识的缺乏。模型几乎总是近似值;例如,自由落体模型忽略空气摩擦,即使没有未知参数,也会在模型与现实之间产生差异。
- 算法不确定性:也称为数值或离散不确定性,源于实现计算机模型时的数值误差和近似。诸如有限元方法或有限差分方法等技术近似求解偏微分方程,会引入误差。数值积分和无穷级数截断是其他示例。
- 实验不确定性:也称为观测误差,来自实验测量的变异性。在相同条件下重复测量会得到不同结果,使得这种不确定性不可避免。
- 插值不确定性:源于模拟或实验数据的缺乏。对于没有数据的输入设置,需要进行插值或外推,从而引入不确定性。
偶然不确定性和认知不确定性
不确定性通常分为两类,在医学应用中尤为突出:
- 偶然不确定性:也称为随机不确定性,表示每次运行相同实验时都会不同的未知量。例如,使用完全重复每次发射的机械弓射出的箭,不会全部命中同一点,因为箭杆的随机振动。该术语源自拉丁语alea(骰子),指机会游戏。偶然不确定性在实践中是不可约的,尽管改进测量理论上可将其转化为认知不确定性。
- 认知不确定性:也称为系统不确定性,源于原则上可以知道但实际上不知道的事物。这可能是由于测量不准确、模型效应被忽略或数据被故意隐藏。例如,常用的重力加速度9.8 m/s²忽略了空气阻力,但测量并纳入阻力可以减少计算重力加速度时的不确定性。
偶然不确定性和认知不确定性可以同时发生。例如,当实验参数表现出偶然不确定性并输入计算机模拟时,从计算机实验中学到的代理模型(如高斯过程或多项式混沌展开)会表现出依赖于或与偶然不确定性相互作用的认知不确定性。这种组合不确定性是一种更一般的推断不确定性。
在实际应用中,两种类型都存在,UQ旨在分别表达它们。量化偶然不确定性相对简单,通常使用传统的频率学派概率和蒙特卡洛方法等技术。概率分布可以用矩表示(对于高斯情况,均值和协方差就足够了,尽管一般来说所有矩并不能唯一确定一个分布),或通过Karhunen–Loève展开和多项式混沌展开表示。认知不确定性通常通过贝叶斯概率来理解,其中概率被解释为信念程度。
不确定性量化方法
UQ采用一系列计算和统计方法:
- 蒙特卡洛方法:涉及重复随机采样以估计输出的概率分布。它们广泛用于偶然不确定性传播,但对于复杂模型可能计算成本高昂。
- 多项式混沌展开:将模型输出表示为输入变量正交多项式的展开,从而实现高效的不确定性传播。当输入分布已知时,它们特别有用。
- 高斯过程代理模型:也称为克里金法,这些代理模型近似昂贵的模拟,提供带有相关不确定性的预测。它们在机器学习中常用于UQ。
- 贝叶斯推断:该框架基于数据更新对模型参数的信念,产生量化认知不确定性的后验分布。它是许多UQ方法的核心。
- 敏感性分析:识别哪些输入不确定性对输出变异性影响最大,指导减少不确定性的资源分配。
在深度学习中,UQ技术包括贝叶斯神经网络、蒙特卡洛丢弃法和集成方法。这些方法估计预测不确定性,这对于可靠的大语言模型输出和其他AI系统至关重要。
应用
UQ应用于多个领域:
- 工程:在结构和航空航天工程中,UQ评估材料和载荷不确定性下的安全裕度。例如,飞机部件的有限元模型结合UQ以确保可靠性。
- 气候建模:气候预测依赖UQ来量化未来温度和降水情景中的不确定性,为政策决策提供信息。
- 医疗保健:在医学诊断和治疗规划中,UQ有助于解释模型预测,例如在影像分析中,不确定性指示检测到异常的置信度。
- 金融:风险评估和投资组合优化使用UQ来建模市场不确定性和极端事件。
- 自主系统:自动驾驶车辆,如Waymo和特斯拉自动驾驶开发的车辆,使用UQ来评估感知和决策的置信度,增强安全性。
- 自然科学:在物理和化学中,UQ量化复杂系统模拟中的实验和建模不确定性。
挑战与未来方向
尽管取得了进展,UQ仍面临若干挑战:
- 计算成本:高保真模拟成本高昂,使得广泛的不确定性传播变得困难。代理模型有所帮助,但会引入自身的不确定性。
- 高维性:具有许多不确定参数的系统需要高效方法以避免维数灾难。
- 模型不充分性:结构不确定性难以量化,因为真实模型未知。贝叶斯模型平均等方法试图解决这一问题。
- 数据稀缺性:在许多应用中,有限的数据阻碍了准确的不确定性估计,尤其是认知不确定性。
未来研究侧重于将UQ与机器学习和深度学习集成,开发可扩展算法,并提高可解释性。随着AI系统日益普及,UQ对于可信赖的决策将至关重要。
与人工智能的关系
在人工智能中,UQ对于模型可靠性至关重要。神经网络模型通常产生过度自信的预测,UQ方法有助于校准置信度。对于大语言模型,UQ可以指示模型对其响应不确定的时机,减少幻觉。像OpenAI、Anthropic和Google DeepMind这样的组织投资于UQ研究以增强安全性。温度缩放和集成方法等技术用于改进校准。UQ还与生成式AI交叉,其中测量生成内容的不确定性是一个活跃领域。
参见
参考文献
本文基于维基百科中关于不确定性量化的条目,该条目提供了该主题的全面概述。