译自英文

聚类是一种无监督机器学习技术,根据定义的相似性度量将相似的数据对象分组为簇,用于模式识别和生物信息学等领域的探索性数据分析。

聚类(又称簇分析)是一种数据分析技术,它将一组对象划分为若干组(即簇),使得同一簇内的对象彼此之间的相似度高于与其他簇中对象的相似度,这种相似度依据分析者定义的特定相似性或距离度量。它是探索性数据分析的主要任务,也是统计数据分析中的常用技术,广泛应用于模式识别、图像分析、信息检索、生物信息学、数据压缩、计算机图形学以及机器学习等领域。作为一种无监督学习方法,聚类不依赖标注数据,而是无需事先了解类别标签即可发现数据中的内在结构和分组。

“聚类”一词涵盖了一系列算法和任务,而非单一特定算法。不同算法在何为构成簇以及如何高效识别簇的理解上差异显著。常见的簇概念包括成员之间距离较小的组、数据空间中的稠密区域、区间或特定统计分布。因此,聚类可以被表述为多目标优化问题,而适当的算法和参数设置(如距离函数、密度阈值或预期簇数)取决于具体数据集和结果的预期用途。聚类分析不是自动任务,而是一个知识发现或交互式多目标优化的迭代过程,通常需要反复试验以调整数据预处理和模型参数,直至结果达到所需属性。

除聚类一词外,还存在多个类似术语,包括自动分类、数值分类学、botryology(源自希腊语βότρυς,意为‘葡萄’)、类型学分析和社区检测。细微差异通常在于结果的用途:在数据挖掘中,所得分组本身是关注重点,而在自动分类中,所得的判别能力是关注重点。

历史

聚类分析起源于人类学领域,始于1932年Driver和Kroeber的研究。1938年Joseph Zubin和1939年Robert Tryon将其引入心理学,1943年起Raymond Cattell在人格心理学的特质理论分类中加以广泛使用。自此,聚类已发展为众多科学学科中的基础工具,几十年来已开发出数百种公开算法。

聚类模型

“簇”的概念无法精确界定,这正是聚类算法多样性的关键原因。存在一个共同点:一组数据对象。然而,不同研究者采用不同的聚类模型,每种模型可由多种算法实现。理解这些聚类模型对于理解算法之间的差异至关重要。典型聚类模型包括:

  • 连通性模型:层次聚类基于距离连通性构建模型,其中簇通过对象的邻近性连接形成。
  • 质心模型:k均值算法以单个均值向量(即质心)表示每个簇,并将对象分配到最近的质心。
  • 分布模型:簇使用统计分布建模,如期望最大化(EM)算法使用的多元正态分布。
  • 密度模型:DBSCAN、OPTICS和HDBSCAN等算法将簇定义为数据空间中由稀疏区域分隔的连通稠密区域。
  • 子空间模型:在双聚类(也称为共聚类或双模式聚类)中,簇同时以簇成员和相关属性建模,允许簇存在于数据的不同子空间中。
  • 分组模型:某些算法不提供结果的精细模型,仅提供分组信息。
  • 图模型:团(图中每两个节点均由边连接的节点子集)可被视为簇的原型形式。完全连通性要求的放宽版本(称为准团)用于HCS聚类算法等算法中。
  • 有符号图模型:在有符号图中,每条路径的符号由边上符号的乘积决定。在平衡理论假设下,边可能改变符号,从而产生二分支图。较弱的“簇性公理”(没有环恰好包含一条负边)会产生多于两个簇或仅含正边的子图的结果。
  • 神经网络模型:最著名的无监督神经网络是自组织映射,此类模型通常可归类为上述一种或多种模型的类似物,包括当神经网络实现主成分分析或独立成分分析形式时的子空间模型。

聚类类型

“聚类”本质上是簇的集合,通常包含数据集中的所有对象。它也可能指定簇之间的关系,例如相互嵌套的簇层次结构。聚类可大致区分为:

  • 硬聚类:每个对象要么属于某个簇,要么不属于。
  • 软聚类(也称为模糊聚类):每个对象以一定程度属于每个簇,例如隶属的可能性。

更细致的区分包括:

  • 严格划分聚类:每个对象恰好属于一个簇。
  • 带离群点的严格划分聚类:对象也可能不属于任何簇,此时它们被视为离群点。
  • 重叠聚类(也称为替代聚类、多视图聚类):对象可能属于多个簇,通常涉及硬簇。
  • 层次聚类:属于子簇的对象也属于父簇,形成树状结构。
  • 子空间聚类:虽然是一种重叠聚类,但在唯一定义的子空间内,簇之间预计不会重叠。

算法

聚类算法可根据其聚类模型进行分类。已发表的聚类算法可能有100多种,且并非所有算法都为其簇提供模型,这使得分类变得困难。不存在客观上“正确”的聚类算法;正如所指出的,“聚类取决于观察者的视角”。事实上,公理化方法表明,任何聚类方法都不可能同时满足三个基本属性:尺度不变性(距离按比例缩放时结果保持不变)、丰富性(数据的所有可能划分均可实现)以及距离与聚类结构之间的一致性。除非有数学理由偏好某种聚类模型,否则特定问题的最适算法通常需要通过实验选择。

主要聚类算法包括:

  • K均值:一种基于质心的算法,通过最小化簇内平方和将数据划分为k个簇。它简单高效,但需指定簇数且对离群点敏感。
  • 层次聚类:以凝聚(自下而上)或分裂(自上而下)方式构建簇的层次结构。它无需预定义簇数并生成树状图。
  • DBSCAN:一种基于密度的算法,将簇识别为被稀疏区域分隔的稠密区域。它能发现任意形状的簇并处理离群点,但需要调整epsilon和最小点数等参数。
  • 期望最大化(EM):一种基于分布的算法,将簇建模为高斯分布,并迭代估计参数以最大化似然。
  • OPTICS:DBSCAN的扩展,生成簇排序,使其对变化密度更为稳健。
  • 自组织映射(SOM):一种神经网络模型,将高维数据映射到低维网格,保持拓扑关系。

应用

聚类在许多领域得到广泛应用。在模式识别中,它有助于识别数据中的分组以用于分类任务。在图像分析中,它用于图像分割和对象检测。在信息检索中,聚类按主题组织文档以用于搜索和推荐。在生物信息学中,它根据相似表达模式对基因或蛋白质进行分组。在数据压缩中,聚类通过用原型表示组来减小数据规模。在计算机图形学中,它有助于颜色量化和网格简化。在人工智能中,聚类是无监督学习的核心技术,使系统能够无需标注示例即可发现模式。

挑战与考虑因素

聚类面临若干挑战。确定最优簇数往往困难,可能需要领域知识或启发式方法。距离度量的选择显著影响结果;常见度量包括欧几里得距离、曼哈顿距离和余弦相似度。高维数据可能受维数灾难影响,导致距离变得不再具有意义。聚类结果对初始化和参数设置敏感,且不存在通用解决方案。此外,聚类的迭代特性意味着应使用内部或外部评估指标(如轮廓系数或Rand指数)验证结果,以确保其满足所需属性。

相关概念

聚类与其他无监督学习技术(如降维和异常检测)密切相关。它常与数据增强结合使用以生成合成样本,或在监督学习的预处理阶段使用。在深度学习背景下,聚类可集成到神经网络架构中以实现表示学习。聚类的原理也支撑着网络分析中的社区检测和商业分析中的市场细分。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:unsupervised-learning·data-analysis·machine-learning·statistics
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史