精确率与召回率

译自英文

精确率和召回率是分类性能指标,分别衡量检索到的实例中相关实例所占的比例,以及相关实例中被检索到的比例。它们量化了假阳性与假阴性之间的权衡。

精确率和召回率是用于评估分类或信息检索系统质量的两项基本性能指标。它们量化了模型从数据集中识别相关项的能力,并平衡了假阳性和假阴性的代价。精确率,也称为阳性预测值,衡量检索到的实例中实际相关的比例。召回率,也称为灵敏度,衡量所有相关实例中被成功检索到的比例。两者结合,比单独使用准确率能更细致地反映模型行为,尤其是在类别不平衡或不同错误代价各异的情况下。

在正式术语中,精确率计算为真正例数量除以系统标记为阳性的总项数(真正例加假阳性)。召回率计算为真正例数量除以实际属于阳性类别的总项数(真正例加假阴性)。例如,考虑一个旨在识别数码照片中狗的程序。如果一张图片包含十只猫和十二只狗,程序将八个元素识别为狗,其中五个实际上是狗(真正例),三个是猫(假阳性),那么七只狗被遗漏(假阴性),七只猫被正确排除(真阴性)。该程序的精确率为5/8,因为八个选定元素中只有五个相关。其召回率为5/12,因为十二只相关狗中只有五只被找到。

与统计错误的关系

精确率和召回率直接对应统计假设检验中的概念。如果零假设是给定项不相关,那么当不相关项被错误选择时发生假阳性(第一类错误),而当相关项被遗漏时发生假阴性(第二类错误)。完美精确率对应零假阳性,意味着每个检索到的项都相关。完美召回率对应零假阴性,意味着每个相关项都被检索到。召回率只是第二类错误率的补数,计算为一减去该比率。精确率与第一类错误率相关,但方式更复杂,因为它还取决于总体中相关与不相关项的先验分布。在狗识别示例中,十只猫中有三个第一类错误,给出第一类错误率为3/10,十二只狗中有七个第二类错误,给出第二类错误率为7/12。

解释与实用性

精确率通常被描述为质量的度量,指示阳性预测的可信度。召回率是数量的度量,指示系统对阳性类别覆盖的完整性。高精确率意味着算法返回的结果大多相关,而高召回率意味着它返回了大多数相关结果,即使也包含一些不相关项。这些指标单独使用时并不特别有用。系统可以通过检索集合中的每一项来实现完美召回率,但这样的系统精确率会非常低。相反,系统可以通过仅选择一个几乎确定相关的项来实现完美精确率,但这会牺牲召回率。在实践中,精确率和召回率通常一起报告,通常通过精确率-召回率曲线来展示,该曲线将精确率绘制为召回率的函数。通常,精确率随召回率增加而降低,反映了两者之间的固有权衡。

精确率-召回率权衡

精确率和召回率之间通常存在反比关系,提高一个往往以降低另一个为代价。最佳平衡取决于具体应用和不同类型错误的相对代价。烟雾探测器是专为召回率设计的系统的经典例子。它故意容易产生误报(第一类错误),因为在真实火灾中未能警报的代价高得令人望而却步。探测器牺牲精确率以确保捕捉所有真实危险。相比之下,刑事司法系统以布莱克斯通比率为指导,即“宁可让十个有罪者逃脱,也不让一个无辜者受罚”,强调精确率。该系统旨在避免定罪无辜者,即使这意味着放走更多有罪者,从而牺牲召回率。

脑外科医生切除癌性肿瘤在个体层面说明了这种权衡。医生必须切除所有肿瘤细胞以防止复发,但也必须避免切除健康脑细胞以保留功能。更宽松的方法,切除肿瘤周围更宽的区域,通过确保所有癌细胞被提取来提高召回率,但也增加了切除健康组织的几率。更保守的方法通过仅针对确认的癌细胞来提高精确率,但冒着留下一些肿瘤细胞的风险。两种结果都有重大后果,医生的选择反映了在该情境下对精确率和召回率赋予的相对权重。

在机器学习中的使用

Machine learning中,精确率和召回率是分类模型的标准评估指标,尤其是在数据集不平衡的领域。例如,在医学诊断中,检测罕见疾病的模型可能仅通过预测多数类就获得高准确率,但精确率和召回率揭示了其实际效用。在Artificial intelligence研究中,这些指标用于比较跨任务(如目标检测、垃圾邮件过滤和文档检索)的模型。它们也是派生指标的基础,如F1分数,即精确率和召回率的调和平均数,提供平衡两者关注的单一数字。这些概念扩展到二元分类之外的多类设置,其中精确率和召回率按类计算然后聚合。

在信息检索中的应用

精确率和召回率起源于信息检索领域,用于评估搜索引擎和数据库查询系统。在此背景下,精确率衡量检索到的文档中与用户查询相关的比例,而召回率衡量集合中所有相关文档中被检索到的比例。搜索引擎经常面临权衡:返回更多结果可以提高召回率,但可能因不相关页面而稀释精确率。排名系统使用固定结果数下的精确率,如精确率在10处,来评估顶部结果的质量。这些指标仍然是评估现代检索系统的核心,包括由Large language modelGenerative AI技术驱动的系统。

局限性与扩展

精确率和召回率有局限性。它们不考虑真阴性,这在某些应用中可能很重要。它们也对阳性类别的选择敏感,其解释取决于阳性类别的先验概率。当阳性类别罕见时,召回率难以提高而不引入许多假阳性。为解决这些问题,研究人员开发了相关指标,如F1分数、精确率-召回率曲线下面积和马修斯相关系数。在实践中,指标的选择取决于应用目标,精确率和召回率通常与其他统计量一起报告,以提供模型性能的完整图景。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:classification·information-retrieval·machine-learning·evaluation-metrics
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史