译自英文

混淆矩阵,又称误差矩阵,是一种表格布局,用于可视化分类算法或个人的性能,展示真正例、假正例、真负例和假负例。它在机器学习中被广泛用于评估监督学习和无监督学习系统。

混淆矩阵,又称误差矩阵,是一种特定的表格布局,用于可视化展示个人或算法在特定任务上的表现。在机器学习中,这些矩阵展示学习系统在监督学习和无监督学习中的成功程度,有时也被称为匹配矩阵。其名称源于该矩阵能轻松识别系统是否混淆了两个类别,即通常将一个类别错误标记为另一个类别。

混淆矩阵起源于人类对听觉刺激的感知研究。后来,它被改编用于机器学习研究,并被弗兰克·罗森布拉特等早期研究者用来比较人类和机器对视觉及听觉刺激的分类。它是一种特殊的列联表,具有“实际”和“预测”两个维度,且两个维度中的类别集合相同。矩阵的每一行代表实际类别中的实例,而每一列代表预测类别中的实例,或者根据所用惯例反之亦然。因此,矩阵的对角线代表所有被正确预测的实例。

二分类示例

考虑一个包含12个个体的样本,其中8人被诊断为癌症(类别1,阳性),4人无癌症(类别0,阴性)。一个分类器用于区分有癌症和无癌症的个体。将这12个个体通过分类器运行后,它做出了9次准确预测,漏掉了3次:2名癌症患者被错误预测为无癌症,1名无癌症者被错误预测为患有癌症。

比较实际和预测的分类会产生四种可能的结果:

  • 真正例(TP):实际为阳性且预测为阳性。
  • 假负例(FN):实际为阳性且预测为阴性。
  • 假正例(FP):实际为阴性且预测为阳性。
  • 真负例(TN):实际为阴性且预测为阴性。

这些结果可以排列成一个2×2混淆矩阵。对于该示例,矩阵将显示:

预测阳性预测阴性
实际阳性6(TP)2(FN)
实际阴性1(FP)3(TN)

所有正确的预测都位于对角线上,这使得错误易于发现,因为它们出现在对角线之外。对行求和可得到数据集中阳性(P = TP + FN)和阴性(N = FP + TN)样本的总数。

混淆表

在预测分析中,混淆表(有时也称为混淆矩阵)是一个二乘二的表格,报告真正例、假负例、假正例和真负例的计数。这允许进行比单纯观察准确率更详细的分析,因为如果数据集不平衡,准确率可能会产生误导。例如,有95个癌症样本和5个非癌症样本,一个将所有内容都标记为癌症的分类器将具有95%的准确率,但对非癌症类别的灵敏度为0%。F1分数等指标也可能存在偏差;信息度消除了这种偏差,对任何形式的猜测都产生0。根据达维德·奇科和朱塞佩·尤尔曼的说法,评估混淆矩阵最有信息量的指标是马修斯相关系数(MCC)。

一些研究人员认为,混淆矩阵及其派生指标不能完全反映模型的知识。矩阵无法显示正确预测是通过合理推理还是偶然(认知运气)实现的,也无法捕捉用于预测的事实后来发生变化的情况(可废止性)。因此,尽管混淆矩阵很有用,但它可能无法完整呈现模型真实可靠性的全貌。

多类混淆矩阵

混淆矩阵不仅限于二分类;它们可用于多类分类器。对于具有k个类别的分类器,矩阵有k行和k列,其中每个单元格(i,j)统计实际类别i被预测为类别j的实例数。对角线代表正确的预测,而对角线之外的单元格显示错误分类。这种布局有助于识别哪些类别通常相互混淆。

派生指标

可以从混淆矩阵计算多种性能指标:

  • 准确率:(TP + TN)/(TP + TN + FP + FN)
  • 精确率:TP /(TP + FP)
  • 召回率(灵敏度):TP /(TP + FN)
  • 特异度:TN /(TN + FP)
  • F1分数:精确率和召回率的调和平均数
  • 马修斯相关系数(MCC):一种考虑所有四个单元格的平衡度量。

这些指标提供了分类器性能的不同视角,尤其是在不平衡数据集中。

在机器学习中的应用

混淆矩阵广泛用于机器学习中评估分类器,包括神经网络模型和深度学习系统。它们在医学诊断、垃圾邮件检测和图像识别等领域至关重要。例如,在人工智能研究中,混淆矩阵有助于比较模型在不同类别上的表现,指导模型架构和训练数据的改进。

局限性与批评

尽管混淆矩阵很有用,但它存在局限性。它无法捕捉预测背后的推理过程,并假设地面真值是静态的。在动态环境中,例如涉及大型语言模型输出的情况,矩阵可能无法反映不断变化的正确性。此外,对于高度不平衡的数据集,准确率和F1分数可能具有误导性,从而促使依赖MCC或信息度等指标。

历史背景

混淆矩阵的概念起源于人类感知研究,特别是在听力学中,矩阵用于衡量一个人如何听到特定单词或声音。弗兰克·罗森布拉特是早期神经网络的先驱,他使用混淆矩阵来比较人类和机器的分类。这一历史联系凸显了矩阵在连接人类和机器性能评估方面的作用。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·evaluation·statistics·classification
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史