译自英文

主成分分析(PCA)是一种线性降维技术,它将高维数据转换到新的坐标系中,捕捉最大方差的方向。它广泛应用于机器学习中的数据可视化、噪声降低和预处理。

主成分分析(PCA)是一种统计程序,它利用正交变换将一组可能相关变量的观测值转换为一组线性不相关变量的值,这些变量称为主成分。该变换的定义使得第一个主成分具有最大的可能方差(即尽可能多地解释数据中的变异性),而每个后续成分在与前一个成分正交的约束下具有最大的可能方差。PCA是机器学习和数据科学中最基本的技术之一,用于探索性数据分析、降维和特征提取。

该方法由卡尔·皮尔逊于1901年提出,后来由哈罗德·霍特林于1933年独立发展。它与Karhunen-Loève变换和奇异值分解(SVD)密切相关。PCA通常在其他算法之前应用,以减少特征数量、缓解维度灾难并提高计算效率。它是一种线性方法,意味着它假设底层结构位于线性子空间上,这对于高度非线性的数据是一个局限。

数学表述

给定一个具有n个观测值和p个变量的数据矩阵X,PCA寻求一组p个正交向量(主成分载荷),以最大化投影数据的方差。第一个主成分是最大方差的方向,第二个与第一个正交并捕获次高方差,依此类推。在数学上,主成分是数据协方差矩阵的特征向量,相应的特征值表示每个成分解释的方差量。

计算通常涉及对数据进行中心化(减去每个变量的均值)并可选地进行缩放(除以标准差)以确保变量具有可比性。然后计算协方差矩阵,并找到其特征向量和特征值。或者,可以使用中心化数据矩阵的SVD来执行PCA,这在数值上更稳定,尤其是在变量数量较大时。

降维与方差解释

PCA的主要用途之一是降维。通过仅选择前k个主成分(其中k远小于p),可以用更少的维度表示数据,同时保留大部分方差。每个成分解释的方差比例由其特征值除以所有特征值之和给出。一个常见的启发式方法是选择k,使得累积解释方差达到阈值,例如95%。

这种缩减在高维环境中特别有用,例如基因组学或图像处理,其中特征数量可能达到数千或数百万。PCA可以帮助在二维或三维中可视化数据,揭示隐藏结构,并通过丢弃低方差成分(通常与噪声相关)来减少噪声。

在机器学习中的应用

PCA被广泛用作机器学习流程中的预处理步骤。它可以提高对相关特征敏感的算法(如线性回归和逻辑回归)的性能。它还有助于通过减少参数数量来减少过拟合。在深度学习中,PCA有时用于在将数据输入神经网络之前进行特征提取,尽管现代网络通常直接处理高维输入。

在计算机视觉中,PCA用于人脸识别(特征脸),其中每个人脸图像被投影到较低维的子空间。在自然语言处理中,PCA可以应用于词嵌入以降低其维度。在金融领域,PCA用于识别驱动资产回报的主要因素。在生物信息学中,PCA是分析基因表达数据和群体遗传学的标准工具。

与其他技术的关系

PCA与因子分析密切相关,但它们的区别在于因子分析假设存在解释变量间相关性的潜在因子,而PCA是一种纯粹的描述性技术,不假设底层模型。PCA还与多维缩放(MDS)相关,后者旨在保留成对距离,以及与t分布随机邻域嵌入(t-SNE)相关,这是一种常用于可视化的非线性技术。

人工智能的背景下,PCA经常与自编码器进行比较,自编码器是学习非线性低维表示的神经网络。虽然PCA是线性的并且具有闭式解,但自编码器可以捕获非线性结构,但需要迭代优化。对于大规模数据,已经开发了随机PCA算法以高效地计算近似主成分。

实际考虑与局限性

PCA假设数据已中心化且主成分是正交的。它对变量的缩放敏感;因此,通常建议对数据进行标准化(z-score归一化),尤其是在变量以不同单位测量时。PCA对异常值也敏感,这些异常值可能不成比例地影响最大方差的方向。已经开发了稳健PCA变体来解决这个问题。

另一个局限性是PCA是一种线性方法,因此可能无法捕获非线性关系。在这种情况下,核PCA或其他非线性降维技术可能更合适。此外,主成分并不总是可解释的,因为它们是所有原始变量的线性组合,这在特定领域的术语中可能难以解释。

软件与实现

PCA在大多数统计和机器学习库中都有实现。在Python中,scikit-learn库提供了一个使用SVD的PCA类。在R中,prcomp和princomp函数是常用的。MATLAB和Julia也有内置的PCA函数。对于非常大的数据集,像Apache Spark的MLlib这样的工具提供了分布式PCA实现。

历史背景与主要贡献者

英国数学家和统计学家卡尔·皮尔逊于1901年在一篇题为“关于空间中点集的最适直线和平面”的论文中引入了PCA。美国统计学家哈罗德·霍特林后来于1933年将该方法形式化,并创造了术语“主成分”。该方法此后成为多元统计和数据分析的基石。

在1980年代和1990年代,PCA随着特征脸用于人脸识别的发展在计算机视觉领域获得了突出地位。最近,PCA已被整合到现代机器学习工作流程中,并且几乎在每门入门数据科学课程中都有教授。它仍然是一个活跃的研究领域,有诸如稀疏PCA、稳健PCA和概率PCA等扩展。

结论

主成分分析是一种强大且多功能的工具,用于在尽可能保留方差的同时降低数据维度。其简单性、数学优雅性和广泛适用性使其成为任何数据科学家或机器学习从业者工具包中的基本技术。尽管其线性性质和某些局限性,PCA仍然被广泛用于数据探索、预处理和可视化,涵盖从人工智能到金融和生物信息学的众多领域。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dimensionality-reduction·statistics·machine-learning·data-analysis
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史