潜变量模型是一类统计模型,其包含的变量并非直接观测所得,而是通过数学模型从其他可观测变量中推断而来。术语“潜”(latent)源自拉丁语“lateo”,意为“隐藏”。这类模型广泛应用于众多学科,包括工程学、医学、生态学、物理学、机器学习、自然语言处理、生物信息学、化学计量学、人口学、经济学、管理学、政治学、心理学以及社会科学。
潜变量可以代表物理现实中原则上可测量但实际不可观测的方面,通常被称为“隐藏变量”。它们也可以对应于抽象概念,如类别、行为状态或心理状态,有时被称为“假设构念”。潜变量的一个关键功能是降维:许多可观测变量可以被聚合以表示一个潜在概念,从而简化数据解释。这反映了科学理论在将可观测的“亚符号”数据与符号模型联系起来时所起的作用。
历史背景
潜过程的思想可以追溯到弗朗西斯·培根的《新工具》(1620年),该书挑战了亚里士多德的逻辑学。培根描述了一种“潜过程”,它超越了感官观察,并强调此类过程不仅仅是表面症状,而是连续的潜在机制。这一哲学基础影响了后来的统计学发展。在20世纪,因子分析和结构方程模型将潜变量推断形式化,其中像查尔斯·斯皮尔曼这样的先驱引入了通用智力因子“g”。
心理学中的应用
在心理学中,潜变量通常通过因子分析得出,代表观测测量之间的共享方差。大五人格特质(外向性、宜人性、尽责性、神经质、开放性)就是使用这种方法推断出来的。其他例子包括空间能力、智慧(通过表现和潜变量测量评估)以及斯皮尔曼的“g”通用智力因子。这些构念并非直接可测,而是从测验项目之间的相关性中显现出来。
经济学与医学中的应用
在经济学中,潜变量包括生活质量、商业信心、士气、幸福感和保守主义。例如,生活质量是从财富、就业、环境、身心健康、教育、娱乐和社会归属感等可观测指标中推断出来的。在医学中,潜变量模型对于纵向研究至关重要,因为在这些研究中,观测时间尺度(如年龄)与疾病进展并不同步。未观测的时间尺度可以被建模为观测时间的变换,从而有助于疾病进展和生长建模。
推断方法与模型
多种模型类别和算法支持潜变量的推断。模型包括线性和非线性混合效应模型、隐马尔可夫模型、因子分析和项目反应理论。推断方法包括主成分分析、偏最小二乘回归、潜在语义分析、期望最大化(EM)算法和Metropolis-Hastings算法。贝叶斯方法也很突出,其技术包括用于主题建模的潜在狄利克雷分配、用于聚类的中国餐馆过程,以及用于特征分配的印度自助餐过程。
在机器学习与人工智能中的作用
在机器学习中,潜变量模型支撑了许多生成式和无监督学习技术。变分自编码器(VAE)和生成对抗网络(GAN)利用潜空间来生成新数据。在深度学习中,由神经网络学习到的潜表示能够捕捉抽象特征。生成式人工智能系统,例如基于Transformer架构构建的大型语言模型,依赖潜表示来建模语言。像麻省理工学院计算机科学与人工智能实验室、斯坦福人工智能实验室和伯克利人工智能研究这样的研究机构为推进这些模型做出了贡献。像OpenAI、Anthropic和Google DeepMind这样的公司则将潜变量方法应用于其人工智能系统,而NVIDIA(未列出)和AMD等硬件提供商则支持其计算需求。
参见
参考文献
- Bacon, Francis. Novum Organum (1620).
- Kmenta, Jan. Elements of Econometrics (1986).