译自英文

可靠性图将预测概率与观测频率进行对比,以评估概率分类器的校准程度,靠近对角线的点表示校准良好的模型。

可靠性图是一种用于评估概率分类器校准情况的图形工具。它将预测概率绘制在x轴上,将正类的观测频率绘制在y轴上。在完美校准的模型中,各点位于对角线y = x上,这意味着当模型预测某事件有70%的发生几率时,该事件大约在70%的情况下确实发生。偏离这条对角线会揭示模型预测中的系统性过度自信或信心不足。

该图通过将预测结果分箱(例如按十分位)并计算每个箱内正类结果的经验频率来构建。每个箱产生一个点,所得曲线提供了对整个概率范围内校准情况的直观摘要。可靠性图广泛应用于气象学、医学诊断和机器学习等领域,以诊断和提高模型的可靠性。

历史起源

可靠性图的概念始于20世纪中叶的气象预报领域。气象学家需要验证降水等事件的概率预报,并开发了图形方法来比较预报概率与观测结果。格伦·W·布里尔在1950年的早期工作引入了布里尔评分作为预报准确度的标量指标,但校准的可视化表示出现较晚。到20世纪70年代,可靠性图已成为气象验证中的标准工具,通常与显示预报概率分布的直方图配合使用。

在此背景中,术语“可靠性”指的是预测概率与观测相对频率之间的统计一致性。在气象学中,该图有时被称为“校准图”或“可靠性曲线”。这种方法后来在20世纪90年代和2000年代被机器学习社区采纳,特别是在概率分类器变得更常见的时期。

构建与解释

要创建可靠性图,首先需要从模型在验证或测试数据集上的验证结果获取预测概率。这些预测被排序并分组到固定数量的箱中,通常为10或20个。对于每个箱,将平均预测概率与正类实例的比例绘制为图。例如,如果一个箱包含0.8至0.9范围内的预测,且对应实例中有85%为正类,则该点(0.85, 0.85)将位于对角线上。

解释涉及检查点到对角线的距离。对角线以上的点表示过不足自信(模型预测的概率低于观测频率),而对角线以下的点表示过度自信。常见的摘要统计量是预期校准误差(ECE),它计算各箱中预测概率与观测概率之间绝对差异的加权平均。较低的ECE值表示更好的校准。

可靠性图通常伴有预测频率直方图,以展示模型预测集中的分布情况。如果模型始终预测概率接近0.5,则直方图会集中在中部,而良好校准的模型可能呈现U形分布,如果它对许多实例具有高置信度。

在机器学习中的应用

Machine learning中,可靠性图已成为评估模型的重心,而不仅仅是原始准确度。现代分类器,尤其是Deep learning模型,通常会产生校准效果不佳的概率估计。例如,使用交叉熵损失训练的Neural network可能表现出过度自信的特性,将高概率分配给不正确的预测。这一由翻书等人在2017年的论文中指出:深层网络往往存在校准缺失,特别是在多类别数据集上。

可靠性图可用于可视化这种校准缺失,并指导校准技术的调整。常见的后处理方法包括Temperature Scaling,通过一个标量参数调整逻辑斯蒂,以及Platt缩放,该方法将逻辑回归拟合到预测概率上。这些方法旨在使可靠性曲线更接近对角线,而不改变模型的预测排名。

该图也用于比较不同模型。例如,相同准确度的两个模型可能具有截然不同的校准特性,而可靠性图揭示了其中一个 - 模型是否产生更可信的概率。对于高风险应用场景,如医疗诊断、自动驾驶和金融风险评估,这一点尤为重要。

在天气预报中的应用

气象学仍是可靠性图的主要应用领域。预报员会为降水、极端温度或严重风暴等事件提供概率预测。通过这些图表,可以验证这些概率在长时间内是否可靠。例如,如果一个预报系统预测30%的降水概率,那么雨应在约30%的日期中出现。可靠性图使预报中心能够监控这种一致性并改进其模型。

欧洲中期天气预报中心及其他机构在其验证系统中常使用可靠性图,通常针对不同提前时间和阈值绘制多条曲线。良好校准的预报系统显示点接近对角线,而系统性偏差则表现为一致的偏离。

与其他指标的关系

可靠性图与归属评分密切相关,后者可分解为可靠性、分辨率和不确定性分量。可靠性分量对应于图对角线的均方偏差。因此,该图的对象提供了布里尔评分一部分的表示。其他指标如ROC曲线下面积(AUC)用于测量判别能力,这与校准不同。一个模型可以具有完美的判别性(将正确的正类排序在负类之上),但在校准方面不佳,反之亦然。

在实践中,判别力和校准两者都很重要。可靠性图仅关注校准,使其与ROC曲线和精确率-召回率曲线相辅相成。一些研究者建议同时报告两者,因为仅良好校准但判别力强或反之的模型都有限。

局限性与扩展

可靠性图存在已知局限性。箱数的选择可能影响视觉结果:箱数过少会掩盖局部校准问题,过多则导致难以解释。该图还假设数据集具有代表性,并且正类定义明确。对于多类别问题,通常为每个类别绘制图表或使用一对多方法。

其扩展包括用于有序分类生存分析的可靠性图。近年来,研究人员提出了替代方案,如使用核平滑的可靠性曲线以避免分箱伪影。也有的工作在图的对数尺度上绘制,以更好可视化极端概率。尽管有所变体,但基础概念保持不变。

软件与实现

许多编程库提供生成可靠性图的函数。在Python中,sklearn.calibration模块包括calibration_curve,返回用于绘图的点。matplotlib库常用于绘制带对角参考线的图。在R中,verification包提供类似功能。这些工具使实践者能够在其模型评估流程中轻松检查校准

Artificial intelligence研究中,可靠性图经常出现在提出新校准方法或分析不确定性的论文中。例如,关于Large language model校准的研究常用于可靠性图,以展示这些模型预测其输出正确性的概率是否与实际准确性一致。这些图示有助于理解模型生成的置信分数与实际准确性之间的有联系。

未来方向

随着机器学习模型变得越来越复杂,并在更关键的应用中部署,校准将持续作为核心关注点。可靠性图很可能仍作为标准诊断工具。可靠性图可能在Generative AITransformer (architecture)-.在这些基于概率的模型中,概率较难定义明确。新的重校准方法,如使用Reinforcement Learning from AI Feedback (RLAIF)或其他对齐技术,可能会基于可靠性图进行评估。

将可靠性图集成到自动化中也是一个趋势。在生产系统中,模型收入生产后,可靠性图可以定时生成并观察漂移,即其动态随设备变化而反馈。这符可信AI的整体目标,即模型不仅需要设计,还需要对其进行校准

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·calibration·visualization·statistics
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史