译自英文

模型校准是将机器学习模型的预测置信度分数与其实际准确率对齐的过程,确保模型所声明的正确性概率反映其真实性能。

模型校准是机器学习中的一个关键方面,指的是模型预测置信度与其实际准确性之间的一致性。校准良好的模型产生的概率估计能准确反映其正确性的可能性。例如,如果模型对一组预测赋予70%的概率,那么这些预测中大约70%应该是正确的。校准不佳可能导致过度自信或信心不足的预测,这在医疗诊断、自动驾驶和金融预测等高风险应用中尤其成问题。

校准与准确性不同。一个模型可能高度准确但校准不佳,反之亦然。例如,一个总是以90%置信度预测多数类别的模型可能达到高准确性,但如果真实阳性率仅为50%,则校准不佳。相反,准确性较低的模型如果其置信度分数准确反映其性能,则可能校准良好。因此,校准是评估模型可靠性的重要指标,尤其是在决策基于预测概率时。

校准的测量

有几种指标用于量化校准。最常见的是期望校准误差(ECE),它计算各分箱中置信度与准确性之间的加权平均差异。模型的预测根据置信度分数分组到分箱中,并计算每个分箱内平均置信度与实际准确性之间的绝对差异。较低的ECE表示校准更好。另一个指标是布里尔分数,它衡量预测概率与实际结果之间的均方误差。布里尔分数结合了校准和分辨率,提供了概率预测质量的综合度量。

可靠性图是评估校准的可视化工具。这些图显示了预测置信度(x轴)与实际准确性(y轴)之间的关系。完美校准的模型会产生一条对角线。偏离此线表示校准不当,对角线以上的点代表信心不足,对角线以下的点代表过度自信。

校准不当的原因

校准不当可能源于多种来源。现代深度神经网络,尤其是那些使用交叉熵损失训练的,通常表现出过度自信。这种趋势会因模型容量、训练时长和正则化技术的使用等因素而加剧。例如,在大型数据集上训练且参数众多的模型可能记忆训练数据,导致对未见示例的过度自信预测。此外,数据不平衡可能导致模型对多数类别过度自信,对少数类别信心不足。

另一个促成因素是分类网络中使用softmax激活。虽然softmax输出总和为一,可以解释为概率,但它们本质上并未校准。网络的logits通过softmax后可能产生不反映真实不确定性的值。这个问题在深度学习模型中尤为突出,这些模型通常训练以最小化交叉熵损失,而没有明确的校准目标。

校准技术

已经开发了几种后处理方法,无需重新训练模型即可改善校准。最广泛使用的是温度缩放,这是一种简单而有效的技术,在应用softmax之前引入一个标量参数(温度)来调整logits。温度在验证集上优化,以最小化负对数似然或ECE。温度缩放保持模型的准确性,同时改善校准,使其在实践中成为受欢迎的选择。

其他方法包括Platt缩放,它对模型输出应用逻辑回归,以及等渗回归,它学习从置信度分数到校准概率的非参数单调映射。等渗回归比温度缩放更灵活,但如果验证集较小,可能过拟合。对于多类问题,矩阵缩放和向量缩放通过将仿射变换应用于logits来扩展温度缩放。

除了后处理,校准也可以在训练期间纳入。诸如标签平滑(将硬标签替换为软目标)等技术已被证明可以改善校准。熵正则化或焦点损失等正则化方法也可以鼓励更好的校准预测。此外,集成方法(平均多个模型的预测)由于方差减少,往往产生更好的校准输出。

大型语言模型中的校准

大型语言模型(LLM),如GPT-4、Claude和Gemini,已将校准推至AI研究的前沿。这些模型常用于问答、推理和决策支持,其中置信度分数至关重要。然而,LLM以校准不佳而闻名,经常在其响应中表现出过度自信。例如,模型可能对事实上不正确的答案声称95%的置信度。

已经提出了几种方法来改善LLM中的校准。一种常见方法是提示模型以自然语言表达不确定性,例如要求其陈述置信度水平。然而,这种方法不可靠,因为模型可能无法准确内省。另一种技术是使用基于采样的方法,其中模型生成多个响应,这些响应的一致性用作置信度的代理。如果模型在样本中产生相似答案,则可能更自信。

后验校准方法,如温度缩放,也可以通过调整生成期间的softmax温度应用于LLM。然而,这需要访问模型的logits,这对于基于API的模型可能不可用。对于此类模型,可以通过在验证集上评估模型的准确性并相应调整其置信度阈值来执行校准。

应用与影响

校准在安全关键领域尤为重要。例如,在医疗保健中,预测疾病概率的诊断模型必须校准良好,以便临床医生做出明智决策。过度自信的预测可能导致漏诊或不必要的治疗。同样,在自动驾驶中,目标检测模型必须提供可靠的置信度分数以避免碰撞。在金融领域,信用评分模型必须准确估计违约概率以管理风险。

校准在模型可解释性和信任中也发挥作用。用户更可能信任提供准确不确定性估计的模型。这在人机回圈系统中尤其相关,其中人类依赖模型置信度来决定何时干预。校准不佳可能破坏这种信任,导致对模型预测的过度依赖或依赖不足。

此外,校准对于不确定性下的决策至关重要。例如,在强化学习中,代理必须估计不同动作的成功概率。校准不当的代理可能承担过度风险或过于谨慎,降低性能。因此,校准是任何机器学习系统中应与准确性一起评估的基本属性。

挑战与未来方向

尽管取得了进展,实现完美校准仍然具有挑战性。模型通常在特定数据集上校准,当数据分布变化时,校准可能退化。正在探索领域适应技术以在分布变化下保持校准。此外,像ECE这样的校准指标存在局限性,例如对分箱选择的敏感性。研究人员正在开发更稳健的指标,如类别级ECE或自适应校准误差,以解决这些问题。

另一个挑战是校准输出结构化预测(如序列或图)的模型。例如,在机器翻译中,模型对翻译句子的置信度不是单个标量,而是对标记的分布。将校准扩展到此类设置是一个活跃的研究领域。

未来的工作可能侧重于开发计算高效且可扩展到大型模型的校准方法。此外,人们对超越简单置信度分数的不确定性量化越来越感兴趣,如贝叶斯神经网络和深度集成。这些方法提供更丰富的不确定性估计,但通常实现更复杂。

总之,模型校准是可靠机器学习的重要组成部分。它确保模型的置信度反映其真实准确性,从而实现更安全、更可信的AI系统。随着AI继续部署在关键应用中,校准的重要性只会增加。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·statistics·artificial-intelligence
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史