精确率和召回率

译自英文

精确率和召回率是分类指标,分别衡量检索到的相关实例所占比例以及相关实例中被检索到的比例,尤其适用于不平衡任务。

精确率和召回率是分类和信息检索中用于评估模型预测质量的两个基本性能指标。精确率,也称为阳性预测值,衡量在所有被检索实例中相关实例所占的比例。召回率,也称为灵敏度,衡量成功检索到的相关实例所占的比例。这两个指标都基于相关性的概念,而相关性通常由具体任务定义,例如识别数据集中的特定类别。

在分类任务中,某个类别的精确率是真阳性(正确标记为属于该类别的项目)的数量除以被标记为属于该类别的项目总数,即真阳性与假阳性之和。召回率是真阳性数量除以实际属于该类别的项目总数,即真阳性与假阴性之和。这些定义与通用公式一致:精确率等于相关检索实例除以所有检索实例,召回率等于相关检索实例除以所有相关实例。

考虑一个旨在识别数字照片中狗的程序。如果一张图片包含十只猫和十二只狗,程序识别出八个元素为狗,其中五个实际上是狗(真阳性),三个是猫(假阳性),那么有七只狗被遗漏(假阴性),七只猫被正确排除(真阴性)。该程序的精确率是5/8,因为八个选定元素中只有五个是相关的。其召回率是5/12,因为十二只相关狗中只有五只被检索到。这个例子说明了精确率和召回率如何捕捉性能的不同方面。

与假设检验的关系

精确率和召回率可以通过假设检验的视角来理解。在典型设置中,零假设是给定项目不相关(例如,不是狗)。当相关项目被错误拒绝时发生第一类错误,这对应于假阳性。当不相关项目被错误接受时发生第二类错误,对应于假阴性。完美精确率(无假阳性)等同于没有第一类错误,而完美召回率(无假阴性)等同于没有第二类错误。

更一般地,召回率是第二类错误率的补数,意味着召回率等于一减去假阴性率。精确率与第一类错误率相关,但方式更复杂,因为它还取决于总体中相关与不相关项目的先验分布。在狗的例子中,十只猫中有三个第一类错误(假阳性),第一类错误率为3/10。十二只狗中有七个第二类错误(假阴性),第二类错误率为7/12。

精确率作为质量,召回率作为数量

精确率通常被视为质量的度量,表示检索到的项目中有多少实际上是相关的。高精确率意味着算法返回的相关结果多于不相关结果。另一方面,召回率是数量的度量,表示检索到了多少相关项目。高召回率意味着算法返回了大多数相关结果,无论是否也返回了不相关结果。

这些指标单独使用时并不是特别有用。例如,通过简单地检索数据集中的每一个项目,可以实现完美召回率。相反,通过仅选择极少数极有可能的项目,可以实现完美精确率,即使许多相关项目被遗漏。因此,精确率和召回率通常一起评估。

在分类任务中,类别C的精确率得分为1.0意味着每个被标记为属于类别C的项目确实属于该类别,但它没有说明类别C中有多少项目未被正确标记。召回率为1.0意味着类别C中的每个项目都被标记为属于类别C,但它没有说明其他类别中有多少项目被错误标记为类别C。

精确率-召回率权衡

通常,精确率和召回率之间存在反比关系。增加一个通常会减少另一个,但应用背景可能决定哪个指标更受重视。例如,烟雾探测器通常设计为产生许多第一类错误,在没有危险的情况下发出警报,因为第二类错误(在重大火灾期间未能发出警报)的成本高得令人望而却步。因此,烟雾探测器设计时以召回率为重点,捕捉所有真实危险,即使以许多误报为代价。

相比之下,刑事司法系统通常强调精确率,正如布莱克斯通比率所反映的那样:“宁可让十个罪犯逃脱,也不让一个无辜者受罚。”这一原则突出了第一类错误(定罪无辜者)的成本。因此,该系统倾向于精确率,避免错误定罪,即使以让更多有罪者逍遥法外为代价,这会降低召回率。

脑外科医生切除癌性肿瘤也说明了这种权衡。医生必须切除所有肿瘤细胞以防止再生,但也必须避免切除健康脑细胞以保留脑功能。如果医生在切除脑区域时更激进,他们会增加召回率(切除所有癌细胞)但降低精确率(切除健康细胞)。如果医生更保守,他们会增加精确率但降低召回率。更高的召回率增加了切除所有癌细胞的机会,但也增加了切除健康细胞的风险。更高的精确率降低了切除健康细胞的风险,但也降低了切除所有癌细胞的机会。

精确率-召回率曲线和组合指标

在实践中,精确率和召回率得分不会孤立讨论。精确率-召回率曲线将精确率绘制为召回率的函数,通常显示精确率随着召回率的增加而降低。该曲线提供了模型在不同阈值下性能的全面视图。或者,可以在另一个指标的固定水平下比较一个指标的值,例如在召回率水平为0.75时的精确率。

几种组合指标同时包含精确率和召回率。F1分数,即精确率和召回率的调和平均值,被广泛用于将模型性能总结为单个数字。F1分数在类别分布不平衡时特别有用,因为它平衡了精确率和召回率之间的权衡。其他指标,如精确率-召回率曲线下的面积,也用于评估模型,特别是在正类稀少的Machine learning任务中。

在机器学习中的应用

精确率和召回率在许多Machine learning应用中至关重要,特别是在分类错误具有不同后果的Artificial intelligence系统中。例如,在Large language model评估中,精确率和召回率可用于评估生成响应或检索文档的相关性。在基于Neural network的分类器中,这些指标指导决策阈值的选择和模型参数的调整。

在不平衡分类问题中,如欺诈检测或医学诊断,准确率通常具有误导性,因为多数类占主导地位。精确率和召回率提供了更细致的视图,允许从业者针对假阳性和假阴性的具体成本进行优化。诸如Data AugmentationLoss Functions等技术通常用于改善此类场景中的精确率和召回率。

局限性和注意事项

虽然精确率和召回率功能强大,但它们有局限性。它们不考虑真阴性,这在某些情况下可能很重要。例如,在具有大量负实例的二分类问题中,具有高精确率和召回率的模型可能仍然有许多假阳性,这可能是有问题的。此外,精确率和召回率对正类的选择敏感,在多类设置中定义可能模糊。

此外,精确率和召回率在不同数据集或任务之间不能直接比较,因为它们取决于正类的基准率。在稀有疾病数据集上具有高召回率的模型可能在常见疾病上表现不佳。因此,在解释这些指标时,考虑上下文以及不同类型错误相关的成本非常重要。

另请参阅

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:classification·evaluation-metrics·machine-learning·information-retrieval
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史