类别效用是一种数值度量,用于概念聚类和机器学习中,评估将对象分组为类别的分类或归类质量。它量化了当已知对象所属类别时,相比未知类别时,预测对象属性能力的提升。该指标由马克·A·格鲁克和詹姆斯·E·科特于1985年提出,旨在指导形成能最大化信息增益或预测能力的类别。此后,它已成为无监督学习任务中的标准目标,尤其是在构建分类体系或生成层次分类的系统中。
其基础理念是,一个好的类别应使已知对象属于该类别的特征更具可预测性。类别效用结合了两个直观标准:类别内相似性,即同一类别中的对象应具有许多共同属性;以及类别间差异性,即不同类别中的对象应有所区别。该指标在概率框架内形式化了这些标准,使其适用于含噪声或不完整的数据。与简单的准确性或纯度度量不同,类别效用考虑了属性预测中的不确定性,奖励那些减少熵的类别。
正式定义与计算
类别效用基于每个类别的概率以及给定类别下属性值的条件概率来计算。对于由二元或名义属性描述的一组对象,该指标定义为已知类别时正确预测属性值的概率的期望增加量,减去无类别信息时的基线预测概率。这将对所有属性求和,并按类别的先验概率加权。
在实践中,对于两类情况,类别效用简化为类别内共享特征数量与类别间共享特征数量之间的权衡。公式通常表示为:CU = (1/n) 对类别求和 P(C) [对属性求和 对值求和 (P(A=a|C)^2 - P(A=a)^2)],其中n是属性数量。概率的平方反映了从类别中随机抽取的两个对象共享该属性值的概率,这是格鲁克和科特在认知心理学基础层面类别研究中的关键见解。
在概念聚类中的应用
类别效用作为几种概念聚类算法的核心评估函数,最著名的是道格拉斯·费舍尔于1987年在University of Toronto开发的COBWEB系统。COBWEB增量构建决策树或类别层次结构,使用类别效用决定每个新对象的放置位置,是合并或拆分现有类别,还是创建新类别。该算法对最大化类别效用的分区进行贪婪搜索,使其能够在无需预先知道类别数量的情况下生成可解释的概率概念层次。
该效用函数也影响了其他聚类方法,并已被应用于数据挖掘和模式识别等领域。例如,它用于聚类高维数据,在这些数据中传统距离度量可能失效。该指标的概率基础使其特别适合处理缺失值,因为它仅对观测到的属性计算期望。
与信息论和心理学的关联
类别效用的概念与信息论有深层联系。它可以解释为类别变量与属性变量之间的互信息,按常数缩放。事实上,格鲁克和科特从他们称为“类别”度量的类别“内聚性”度量中推导出它,该度量与G指数密切相关。这一理论联系有助于证明其作为特征选择和评估聚类解决方案标准的合理性,因为它直接量化了分类对对象属性不确定性的减少程度。
类别效用最初源于对基础层面类别的认知科学研究,,人类觉得最自然的抽象层次(例如,“狗”与“动物”或“比格犬”)。格鲁克和科特的实验表明,基础层面对应于类别效用最高的类别,表明该度量捕捉了心理学相关的原则。这一联系引起了研究类人概念学习的Artificial intelligence和Machine learning研究者的兴趣,包括MIT CSAIL和Stanford AI Lab等机构的研究人员。
扩展与改进
自引入以来,已提出多种类别效用的扩展,以解决局限性或适应特定领域。一种扩展通过使用概率密度估计处理连续属性,通常假设正态分布并随传入数据更新。另一种修改引入属性加权,允许某些特征对效用计算的贡献大于其他特征,这在领域知识表明某些属性更重要时很有用。
在Deep learning和现代Artificial intelligence的背景下,类别效用已被视为无监督表示学习的替代目标,,将潜在特征组织成可解释的聚类。然而,其使用在很大程度上已被更大规模的方法所取代,如Generative AI和基于Transformer (architecture)的模型,这些模型学习分布式表示而非离散类别。然而,对于需要可解释分组的任务,例如Figure AI的机器人技术或Commure的医疗数据分析,类别效用仍提供了一种有原则且透明的黑盒聚类替代方案。
局限性与批评
类别效用并非没有缺点。它假设属性在给定类别下是独立的,这是一个强假设,在现实世界数据中经常被违反,因为特征往往是相关的。该指标还偏向于大小大致相等的类别,因为它按类别先验概率加权,这在数据不平衡时可能不理想。此外,概率的平方可能对属性值频率敏感,在某些条件下导致对稀有值的偏倚。
尽管存在这些问题,类别效用仍然是一个历史上重要的指标,为聚类和概念学习的许多后续发展奠定了基础。它强调预测效用而非单纯相似性,这与Machine learning和Artificial intelligence的更广泛目标一致:通过有意义的抽象构建能泛化到未见数据的模型。至今,它仍在许多认知建模和无监督学习的研究生课程中教授,确保其持续影响。未来工作可能会重新审视该指标,因为该领域寻求更可解释和概率性的分类方法,可能在BAIR (Berkeley AI Research)或Xerox PARC等研究实验室,这些地方的基础算法经常被重新评估。