布赖尔评分是一种用于评估概率预测质量的适当评分规则。它通过计算分配给事件的预测概率与实际结果之间的均方差异来量化预测的准确性,其中如果事件发生,结果编码为1,否则为0。较低的布赖尔评分表示更好的预测性能,0分代表完美预测,1分代表二元事件的最差可能预测。该指标由格伦·W·布赖尔于1950年在《每月天气评论》上发表的一篇论文中引入,最初设计用于天气预报,但后来被金融、医学和机器学习等领域采用。
布赖尔评分属于一类称为适当评分规则的指标,这些规则激励预测者报告其真实信念,而不是对冲或夸大。对于二元结果,布赖尔评分计算为(f - o)^2的平均值,其中f是预测概率,o是观察到的结果(0或1)。该评分可以分解为三个部分:可靠性、分辨率和不确定性,这些部分提供了对预测质量不同方面的洞察。可靠性衡量预测概率与观察频率的匹配程度,分辨率衡量预测区分不同结果组的能力,而不确定性表示事件本身的固有变异性。
布赖尔评分与其他适当评分规则(如对数评分和球形评分)密切相关,但它的优势在于对于二元事件,其值介于0和1之间,易于解释。在多类问题中,该评分通过将所有类别的平方差异求和来推广,并且可以通过类别数进行归一化。该指标还用于集成预测,其中多个模型产生概率估计,以及校准评估,帮助识别预测概率中的系统性偏差。
历史发展
格伦·W·布赖尔是美国气象局的气象学家,于1950年引入了该评分,作为评估概率天气预报准确性的一种方式。他最初的论文题为“以概率表达的预测验证”,提出了均方误差作为预测技能的度量。布赖尔评分在1950年代和1960年代在气象学界获得了关注,特别是随着产生概率输出的数值天气预报模型的出现。1973年,艾伦·H·墨菲和罗伯特·L·温克勒通过将评分分解为可靠性、分辨率和不确定性组件,为该评分的理论理解做出了贡献,这成为预测验证的标准框架。
在1980年代和1990年代,布赖尔评分在气象学之外找到了应用。统计学家和经济学家开始使用它来评估金融中的概率预测,例如预测股票市场波动或信用违约。在2000年代,机器学习和人工智能的兴起使布赖尔评分成为模型评估的主流,特别是对于输出概率而非硬标签的分类任务。该评分现在是许多机器学习库中的标准指标,并用于Kaggle挑战等竞赛中。
数学定义
对于二元事件,观察到的结果y(如果事件发生,y = 1;否则y = 0)和预测概率p(其中0 ≤ p ≤ 1),单个预测的布赖尔评分定义为BS = (p - y)^2。对于一组N个预测,平均布赖尔评分是这些平方差异的平均值:BS = (1/N) Σ (p_i - y_i)^2。评分范围从0到1,0表示完美准确性,1表示预测与结果完全相反时的最差评分。
对于具有K类的多类问题,布赖尔评分定义为BS = (1/N) Σ Σ (p_ij - y_ij)^2,其中p_ij是实例i中类别j的预测概率,y_ij在真实类别为j时为1,否则为0。这种表述确保评分保持有界,最大值取决于类别数。多类布赖尔评分常用于输出多个类别概率分布的深度学习模型中。
布赖尔评分也可以用校准和细化来表示。校准指预测概率与观察频率之间的一致性,而细化指预测的锐度。具有高细化和良好校准的模型将具有较低的布赖尔评分,而校准差且细化低的模型将具有较高的评分。
分解与解释
布赖尔评分可以分解为三个加性组件:可靠性(REL)、分辨率(RES)和不确定性(UNC)。分解公式为BS = REL - RES + UNC。可靠性衡量每个概率区间内预测概率与观察频率之间的均方差异。较低的可靠性表示更好的校准。分辨率衡量不同概率区间内观察频率的方差,较高的分辨率表示预测可以有效区分不同的结果组。不确定性是观察结果的方差,独立于预测,表示事件的固有不可预测性。
这种分解对于诊断模型性能特别有用。例如,如果模型具有高可靠性但低分辨率,则可能对其预测过于自信。相反,如果模型具有高分辨率但可靠性差,则可能区分良好但校准不佳。分解允许从业者识别具体的改进领域,例如使用温度缩放或基于批量归一化的方法重新校准概率。
在实践中,布赖尔评分通常与基线(如气候平均值或恒定预测)进行比较。布赖尔技能评分(BSS)是归一化版本,表示预测相对于参考预测的改进,计算为BSS = 1 - (BS_预测 / BS_参考)。正BSS表示预测优于参考,而负BSS表示性能较差。
在机器学习中的应用
在机器学习中,布赖尔评分通常用于评估概率分类器,特别是在二元分类任务中。许多模型,如逻辑回归、神经网络和大型语言模型,输出概率可以直接使用布赖尔评分进行评估。与仅考虑预测类别标签的准确性不同,布赖尔评分同时惩罚错误预测和过度自信或自信不足的概率。这使其成为预测置信度重要的应用中的宝贵指标,如医疗诊断、自动驾驶和金融风险评估。
布赖尔评分也用于集成方法,其中多个模型产生概率估计并取平均。在这种情况下,评分有助于评估集成的校准,并可以指导模型选择或单个预测的加权。此外,布赖尔评分用于强化学习和生成式人工智能中,以评估概率输出的质量,例如在top-k采样或top-p采样策略中用于文本生成。
在人工智能安全和可靠性方面,布赖尔评分用于衡量大型语言模型的校准。例如,由OpenAI和Anthropic开发的模型通常根据其提供校准良好的置信度估计的能力进行评估。低布赖尔评分表示模型的置信度与其实际准确性一致,这对于在现实世界应用中可信部署至关重要。
与其他指标的比较
布赖尔评分是几种适当评分规则之一,包括对数评分(对数损失)和球形评分。对数评分定义为-log(p_y),其中p_y是真实结果的预测概率,它对极端概率比布赖尔评分更敏感。球形评分定义为p_y / sqrt(Σ p_j^2),它是有界的,对异常值不太敏感。布赖尔评分通常更受青睐,因为它有界、易于解释,并且比对数评分对极端值更不敏感。
与准确性相比,布赖尔评分提供了对概率预测更细致的评估。准确性仅衡量正确标签的比例,忽略预测的置信度。例如,一个预测正确类别为0.51、错误类别为0.49的模型与预测正确类别为0.99的模型具有相同的准确性,但后者的布赖尔评分要低得多。这使得布赖尔评分在概率估计用于决策的领域中特别有用。
布赖尔评分也与接收者操作特征曲线下面积(AUC-ROC)相关,但它们衡量性能的不同方面。AUC-ROC侧重于排序能力,而布赖尔评分侧重于校准和准确性。模型可以具有高AUC-ROC但布赖尔评分差,如果其概率未校准,反之亦然。因此,布赖尔评分通常与AUC-ROC结合使用,以提供全面评估。
局限性与考虑
布赖尔评分的一个局限性是它对事件的基准率敏感。对于稀有事件,不确定性组件较低,评分主要由可靠性和分辨率主导。这使得在不同基准率的数据集之间比较评分变得困难。此外,布赖尔评分不考虑不同类型错误的成本,如假阳性与假阴性,这在某些应用中可能很重要。
另一个考虑是,布赖尔评分假设预测概率已良好校准,并且结果是二元或分类的。对于连续结果,其他指标如连续排名概率评分(CRPS)更合适。布赖尔评分也不直接衡量预测的锐度,即预测集中在单个值周围的程度。具有高锐度但校准差的模型可能比锐度较低但校准更好的模型具有更高的布赖尔评分。
在实践中,布赖尔评分应与其他指标(如校准图和可靠性图)结合使用,以全面理解模型性能。考虑应用背景也很重要,因为校准和分辨率之间的最佳权衡可能因用例而异。
近期发展与未来方向
随着深度学习和Transformer模型的兴起,布赖尔评分已成为许多研究论文和行业应用中的标准评估指标。近期工作侧重于改善神经网络的校准,使用温度缩放、丢弃和模型剪枝等技术来降低布赖尔评分。在生成式人工智能领域,布赖尔评分用于评估大型语言模型的校准,特别是在问答和推理任务中。
研究人员还探索了布赖尔评分在更复杂设置中的扩展,如多标签分类和有序回归。在多标签分类中,布赖尔评分可以独立计算每个标签然后取平均,提供整体校准的度量。在有序回归中,布赖尔评分可以适应考虑类别的顺序,这在评级系统等应用中很重要。
布赖尔评分仍然是一个活跃的研究领域,持续努力开发对异常值更稳健且更适合高维数据的新评分规则。随着机器学习模型变得更加复杂并部署在关键应用中,像布赖尔评分这样的适当评分规则的重要性可能会增长,确保概率预测既准确又校准良好。