变分自编码器(VAE)细节

译自英文

变分自编码器(VAE)是一种于2013年引入的深度生成神经网络,它学习一个概率潜在空间,将输入映射为分布而非点,并通过最大化证据下界进行训练。

变分自编码器(VAE)是一种人工神经网络架构,由Diederik P. Kingma和Max Welling于2013年提出。它属于概率图模型和变分贝叶斯方法的家族。VAE结合了一个编码器网络和一个解码器网络,通过一个通常遵循多元高斯分布的概率潜在空间连接。编码器将每个输入数据点(如图像)映射到潜在空间中的一个分布,而不是映射到单个点,而解码器则从潜在空间映射回输入空间。这种概率映射有助于避免对训练数据的过拟合。该模型使用重参数化技巧进行训练,最初设计用于无监督学习,但它在半监督和监督学习任务中也被证明是有效的。

VAE是一种生成模型,学习数据集的潜在概率分布。它优化数据似然的一个下界,称为证据下界(ELBO),该下界在计算上是可处理的。编码器充当摊销推断网络,联合优化所有数据点的变分后验,与逐数据点优化相比,这带来了显著的内存节省。解码器从潜在变量生成数据,两个网络共同训练,以最小化由重构项和Kullback-Leibler(KL)散度项组成的损失函数。

架构与操作

VAE架构由两个主要组件组成:编码器和解码器。编码器是一个神经网络,接收输入数据点并输出变分分布的参数,通常是高斯分布的均值和方差。它将输入空间映射到低维潜在空间。解码器是第二个神经网络,将潜在空间映射回输入空间,通常产生噪声分布的均值。在某些实现中,解码器也输出方差参数,但为了简化可以省略,方差通过梯度下降进行优化。

训练目标涉及从概率模型的自由能表达式中导出的两个项:重构误差和KL散度。重构项衡量解码器从潜在变量重构输入的效果,需要采样近似来计算其期望。KL散度项衡量变分后验与潜在变量先验分布之间的差异,最大化概率质量的重叠。噪声分布的选择取决于数据类型;例如,高斯噪声通常用于连续数据(如图像),而伯努利噪声用于二值数据(如二值化的MNIST数字)。

公式化

从概率建模的角度来看,目标是最大化数据\(x\)在参数化分布\(p_\theta(x) = p(x|\theta)\)下的似然,通常选择为高斯分布。然而,当对潜在变量\(z\)假设先验时,边际似然\(p_\theta(x) = \int_z p_\theta(x,z) dz\)变得难以处理。为了解决这个问题,VAE引入了一个由编码器参数化的变分后验\(q_\phi(z|x)\),并优化ELBO:

\[\log p_\theta(x) \geq \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{KL}(q_\phi(z|x) \| p_\theta(z))\]

第一项是重构似然,第二项是变分后验与先验之间的KL散度。重参数化技巧允许梯度通过采样过程流动,通过将\(z\)表示为编码器输出和随机噪声变量的确定性函数,从而实现标准的反向传播。

训练与优化

训练VAE涉及使用随机梯度下降最小化负ELBO。重构项通常使用蒙特卡洛采样进行近似,而KL散度在先验和后验均为高斯分布时通常可以解析计算。重参数化技巧对训练至关重要,因为它将潜在变量采样的随机部分与确定性部分分离。噪声模型的方差可以单独学习或固定。

最近的方法探索用其他统计距离(如Wasserstein距离)替代KL散度,以解决模式崩溃等问题并提高生成样本的质量。这些变体通常被称为统计距离VAE变体。

应用

变分自编码器已广泛用于生成任务,包括图像生成、异常检测和表示学习。它们在无监督学习中特别有效,学习数据的紧凑潜在表示。VAE也已应用于半监督学习,利用未标记数据提高标记任务的性能,并在某些情况下用于监督学习。该架构启发了许多扩展,如条件VAE(将类标签纳入生成过程)和层次VAE(使用多层潜在变量)。

变体与扩展

已经开发了多种VAE变体以提高性能并解决局限性。beta-VAE在KL散度项上引入权重因子\(\beta\),以鼓励更解耦的表示。VQ-VAE(向量量化VAE)使用离散潜在变量,适用于文本和音频生成等任务。其他扩展包括CVAE(条件VAE),根据辅助信息条件化生成,以及VAE-GAN,将VAE与生成对抗网络结合以产生更清晰的图像。这些变体扩展了VAE在不同领域的适用性。

与其他模型的关系

VAE与其他生成模型密切相关,如生成对抗网络(GAN)和归一化流。GAN专注于生成逼真样本而不显式计算似然,而VAE提供了一个具有可处理目标的原则性概率框架。归一化流提供精确的似然计算,但通常计算成本更高。VAE的编码器-解码器结构也与传统自编码器相似,但概率潜在空间和正则化使其区别于确定性自编码器。

局限性与未来方向

尽管取得了成功,VAE仍有局限性,包括与GAN相比倾向于产生模糊样本,这归因于高斯噪声假设和重构目标。KL散度也可能导致后验崩溃,即潜在变量变得无信息。正在进行的研究旨在通过改进先验、更具表现力的后验和替代散度度量来解决这些问题。VAE仍然是Deep learningGenerative AI中的基础模型,在学术研究和实际应用中持续具有相关性。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·generative-models·probabilistic-models
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史