译自英文

无监督学习是一种机器学习方法,在这种方法中,模型在无标签输出的数据中发现模式、分组或结构,而无需被告知正确答案是什么。

无监督学习是机器学习的一个类别,其中模型获得没有标注输出的数据,必须自行发现结构、模式或分组,而不是像监督学习那样被训练来重现已知的正确答案。由于无监督方法不需要人工标注的标签,它们可以直接应用于世界上大量可用的原始、未标记数据,如非结构化文本、图像或交易日志,这使得该方法在标注成本高昂、速度缓慢或根本无法大规模进行的情况下具有吸引力。

核心任务

最常见的无监督任务是聚类,它将相似的数据点分组在一起,而无需预定义类别,使用诸如k均值或层次聚类等算法;零售商可能会根据购买行为对客户进行聚类,而无需事先知道结果应为何种细分。降维技术,包括主成分分析和自编码器,将高维数据压缩为较少数量的变量,同时尽可能保留其底层结构,通常用于可视化或作为其他模型的预处理步骤。异常检测使用无监督方法标记与数据集主体差异显著的数据点,应用于欺诈检测和工业监控。密度估计和生成建模,以生成对抗网络扩散模型为代表,学习数据集的底层概率分布,足以从中生成新的、逼真的样本。

历史

聚类和主成分分析等无监督技术源于统计学,其历史远早于现代机器学习,而神经方法用于无监督学习,包括20世纪80年代由约翰·霍普菲尔德开发的早期自编码器和霍普菲尔德网络,也早于深度学习时代。然而,在2000年代和2010年代初期的大部分时间里,基于大型标注数据集的监督学习在大多数实际基准上优于无监督方法,无监督学习主要被视为探索性分析的工具或预处理步骤,而非通往最先进结果的途径。

与自监督学习的关系

无监督学习与自监督学习之间的区别经常引起混淆。自监督学习有时被描述为无监督学习的子集或现代重构:两者都使用未标记数据,但自监督方法从数据本身构建一个明确的、自动生成的预测任务,例如预测掩码词或序列中的下一个标记,这为它们提供了类似于监督学习的清晰训练信号,尽管没有任何人类标注过数据。这一区别很重要,因为自监督预训练,而非经典意义上的聚类或降维无监督学习,才是现代大型语言模型和其他基础模型训练的动力来源。

应用与意义

无监督学习仍广泛用于探索性数据分析、客户细分、主题建模、推荐系统预训练,以及作为异常和欺诈检测流程的组成部分。在深度学习中,其生成分支,GAN和后来的扩散模型,通过学习建模和采样复杂数据分布(如自然图像空间),成为现代文本到图像文本到视频系统的基础。

局限性

由于无监督学习没有可对照的基准答案,评估其结果本质上比评估监督模型更困难且更主观:聚类结果不能像分类预测那样简单地评分为“正确”或“错误”,并且应用于同一数据的不同无监督算法可能产生有意义的、同样合理的不同分组。这种模糊性部分解释了为什么该领域近期最大的成功,特别是在语言和图像生成方面,依赖于更结构化的自监督范式,而非经典的无监督聚类和密度估计方法。

分类:machine-learning·model-training
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史