受试者工作特征曲线,简称ROC曲线,是一种图形化绘图,用于展示二元分类器模型在不同阈值设置下的性能。尽管它可以推广到多类别问题,但最常用于二元分类问题。ROC分析经常用于临床流行病学中诊断测试性能的评估,也应用于机器学习、放射学、生物识别和预测领域。该曲线提供了在所有可能分类阈值下灵敏度与特异度之间权衡的全面视图,使得无需指定特定工作点即可进行模型比较。
ROC曲线是在每个阈值设置下,以真阳性率(TPR)为纵轴、假阳性率(FPR)为横轴绘制的图。真阳性率,也称为灵敏度或检测概率,衡量实际阳性被正确识别的比例。假阳性率,也称为误报概率,等于1减去特异度,衡量实际阴性被错误分类为阳性的比例。该曲线也可以解释为决策规则统计功效随I型错误变化的图。当真阳性和假阳性结果的概率分布已知时,ROC曲线通过检测概率的累积分布函数(纵轴)对假阳性概率的累积分布函数(横轴)获得。
ROC分析提供了工具,用于在指定成本背景或类别分布之前,独立地选择可能最优的模型并丢弃次优模型。它与诊断决策制定的成本/收益分析有直接且自然的关联。ROC曲线下面积(AUC)是一个单一标量值,总结了分类器的整体性能,值越接近1表示判别能力越好,0.5表示性能等同于随机猜测。
术语
真阳性率也称为灵敏度、召回率或检测概率。假阳性率也称为误报概率,等于1减去特异度。ROC曲线也称为相对工作特征曲线,因为它比较了随着标准变化而变化的两个工作特征(TPR和FPR)。在某些领域,该曲线被称为灵敏度对(1减去特异度)图。术语“阳性”和“阴性”指预测的类别标签,而“真”和“假”表示预测是否与实际真实情况匹配。
历史
ROC曲线最初由电气工程师和雷达工程师在第二次世界大战期间开发,用于检测战场上的敌方目标,始于1941年。这一起源导致了其名称“接收器工作特征”,因为它描述了雷达接收器的工作特征。该技术很快被引入心理学,用于解释对刺激的感知检测,特别是在信号检测理论中。在随后的几十年中,ROC分析被应用于医学、放射学、生物识别、自然灾害预测、气象学和模型性能评估。近年来,它越来越多地被用于Machine learning和数据挖掘研究中,作为评估分类模型的标准工具。
基本概念
分类模型是将实例映射到特定类别或群体的映射。分类器输出可以是任意实数值,需要阈值来确定类别边界,也可以是离散的类别标签。考虑一个两类预测问题,其中结果标记为阳性(p)或阴性(n)。二元分类器产生四种可能结果:真阳性(TP)发生在预测为p且实际值为p时;假阳性(FP)发生在预测为p但实际值为n时;真阴性(TN)发生在预测和实际值均为n时;假阴性(FN)发生在预测为n但实际值为p时。
例如,在疾病诊断测试中,假阳性发生在人测试为阳性但实际上没有患病时。假阴性发生在人测试为阴性但实际上患病时。这四种结果可以组织在2x2列联表中,也称为混淆矩阵,这是计算各种评估指标的基础。
ROC空间
ROC空间由横轴上的假阳性率和纵轴上的真阳性率定义。这种图形表示描绘了真阳性(收益)和假阳性(成本)之间的相对权衡。每个预测结果或混淆矩阵实例代表ROC空间中的一个点。最佳可能的预测方法将产生左上角坐标(0,1)的点,表示100%灵敏度(无假阴性)和100%特异度(无假阳性)。该点称为完美分类。
随机猜测将给出沿对角线上的点,称为无判别线,该线从左下角延伸到右上角。随机猜测的直观示例是抛硬币决策。随着样本量增加,随机分类器的ROC点趋向于对角线;对于平衡硬币,它趋向于点(0.5, 0.5)。对角线将ROC空间分为两部分:对角线上方的点代表良好的分类结果(优于随机),而下方的点代表差的结果(劣于随机)。值得注意的是,持续差的预测器的输出可以通过反转来获得好的预测器,因为将点围绕中心(0.5, 0.5)镜像会产生互补分类器。
阈值变化
ROC曲线通过变化分类阈值并在每个阈值设置下绘制相应的TPR和FPR来生成。对于输出连续分数的分类器,降低阈值会增加TPR和FPR,而提高阈值会减少两者。曲线从最高阈值(没有实例被分类为阳性)的点(0,0)到最低阈值(所有实例被分类为阳性)的点(1,1)追踪路径。曲线上的每个点对应一个特定阈值,允许从业者根据应用需求选择平衡灵敏度和特异度的工作点。
曲线下面积
ROC曲线下面积,通常缩写为AUC,是一种广泛使用的汇总指标。AUC表示分类器将随机选择的阳性实例排名高于随机选择的阴性实例的概率。AUC为1.0表示完美判别,而AUC为0.5表示性能不优于随机猜测。AUC值低于0.5表明分类器性能差于随机,这可能表明标签错误或反转预测会改善性能。AUC特别适用于比较多个分类器,因为它提供了一个独立于阈值选择和类别分布的单一数字。
应用
ROC分析应用于众多领域。在临床流行病学中,它用于评估诊断测试的准确性,如高血压的血压测量或疾病检测的生物标志物。在放射学中,ROC曲线帮助评估成像技术和放射科医生解释的性能。在生物识别中,它们用于评估指纹和人脸识别系统。在气象学中,ROC分析应用于预测验证,如自然灾害预测。在Machine learning中,ROC曲线是评估二元分类器的标准工具,包括用于Deep learning和Neural network模型的分类器。该技术也适用于评估Large language model输出,在内容审核或情感分析等任务中,基于连续置信度分数做出二元决策。
局限性和考虑因素
ROC曲线具有某些局限性。它们主要设计用于二元分类,虽然推广到多类别是可能的,但需要更复杂的方法,如一对多或一对一策略。该曲线不直接纳入假阳性和假阴性的成本,这些成本可能因应用而异。此外,当类别分布高度不平衡时,与关注阳性类别的精确率-召回率曲线相比,ROC曲线可能呈现过于乐观的性能视图。尽管存在这些局限性,ROC分析仍然是模型评估中的基本工具,因为它具有阈值独立性和直观的图形表示。