VAE 细节(高级)

译自英文

变分自编码器(VAE)是一种生成式神经网络架构,由Diederik P. Kingma和Max Welling于2013年提出,它将概率图模型与变分贝叶斯方法相结合,以学习数据的潜在表示。

变分自编码器(VAE)是一种人工神经网络架构,由Diederik P. Kingma和Max Welling于2013年提出。它属于概率图模型和变分贝叶斯方法的家族。VAE是生成模型,学习将输入数据编码到概率潜空间,并将该空间的样本解码回原始数据域,从而实现数据生成、去噪和表示学习等任务。

该架构由两个神经网络组成:编码器和解码器。编码器将大型复杂数据集中的每个数据点(如图像)映射到潜空间中的分布,而非单个点。该分布通常是多元高斯分布,由均值和方差参数化。解码器执行相反的功能,从潜空间映射回输入空间,同样根据分布进行,尽管在实践中解码时很少添加噪声。通过映射到分布而非单个点,网络避免了过拟合训练数据。两个网络通常使用重参数化技巧联合训练,尽管噪声模型的方差可以单独学习。

架构与操作概述

变分自编码器是一种具有先验和噪声分布的生成模型。此类传统模型使用期望最大化元算法训练,如概率PCA或稀疏编码。这些方案优化数据似然的下界,该下界通常计算上难以处理,并需要发现q分布或变分后验。这些q分布通常针对每个单独数据点在单独的优化过程中参数化。

VAE转而使用神经网络作为摊销方法,跨数据点联合优化。相同参数被多个数据点重用,从而大幅节省内存。第一个神经网络以数据点为输入,输出变分分布的参数。由于它从已知输入空间映射到低维潜空间,因此称为编码器。解码器是第二个神经网络,从潜空间映射到输入空间,例如作为噪声分布的均值。可以使用另一个神经网络映射到方差,但为简化可以省略,方差通过梯度下降优化。

为优化模型,需要两个项:重构误差和Kullback-Leibler散度(KL-D)。两者均源自概率模型的自由能表达式,并根据噪声分布和数据的假设先验而有所不同。例如,标准VAE任务如IMAGENET通常假设高斯噪声,而二值化MNIST等任务需要伯努利噪声。KL-D项最大化q分布与p分布重叠的概率质量,这可能导致模式寻求行为。重构项是自由能表达式的剩余部分,需要采样近似来计算其期望值。更近期的方法用各种统计距离替代KL-D。

公式化

从概率建模的角度,目标是在选定的参数化概率分布p_θ(x) = p(x|θ)下最大化数据x的似然。该分布通常选择为高斯分布N(x|μ, σ),由μ和σ参数化,作为指数族成员易于处理。简单分布易于最大化,但具有潜变量z先验的分布会导致难以处理的积分。似然p_θ(x)通过对z边缘化得到:

p_θ(x) = ∫ p_θ(x, z) dz,

其中p_θ(x, z)是可观测数据x和潜编码z的联合分布。根据链式法则,这变为:

p_θ(x) = ∫ p_θ(x|z) p_θ(z) dz。

该积分通常难以处理,因此使用变分推断。编码器网络用变分分布q_φ(z|x)近似真实后验p_θ(z|x),通常为高斯分布。解码器建模p_θ(x|z)。训练优化证据下界(ELBO),该下界平衡重构精度和向先验的正则化。

重参数化技巧

重参数化技巧是使用反向传播训练VAE的关键技术。从编码器输出分布q_φ(z|x)采样不可微,这阻止了梯度流动。该技巧将潜变量表示为z = μ + σ ⊙ ε,其中ε从标准正态分布N(0, I)采样。这分离了随机部分(ε)与确定性参数(μ和σ),允许梯度通过网络流动。该技巧与VAE于2013年一同引入,已成为变分深度学习中的标准方法。

ELBO与损失函数

训练目标是证据下界(ELBO),源自自由能表达式。ELBO由两项组成:重构项和KL散度项。重构项E_{q_φ(z|x)}[log p_θ(x|z)]衡量解码器从潜样本重构输入的效果。KL项D_KL(q_φ(z|x) || p(z))通过惩罚偏离先验p(z)(通常为标准高斯分布)来正则化编码器。总损失为负ELBO,通过梯度下降最小化。KL项鼓励潜空间平滑且连续,而重构项确保对数据的保真度。

应用与扩展

尽管最初设计用于无监督学习,VAE已被证明对半监督和监督学习有效。它们用于图像生成、异常检测、药物发现和表示学习。变体包括条件VAE(CVAE),其基于额外输入进行条件化,以及beta-VAE,其加权KL项以实现解耦表示。近期工作用其他统计距离替代KL-D,以解决模式崩溃并提高样本质量。VAE也是Generative AI的基础,与Large language model等其他模型并列,尽管它们在架构和应用上有所不同。

与其他模型的关系

VAE是更广泛Deep learning领域的一部分,与Neural network架构如Residual Network (ResNet)U-Net相关。它们与Encoder-Decoder Architecture模型和Sequence-to-Sequence (Seq2Seq)框架有概念联系,尽管VAE侧重于概率潜空间。与Artificial intelligence系统如OpenAI的GPT系列中使用的Transformer (architecture)基础模型不同,VAE通常较小,用于连续数据。MIT CSAILStanford AI Lab等机构的研究推进了VAE理论,而Google DeepMindAmazon Web Services等公司已将其应用于生产系统。

局限性与未来方向

与生成对抗网络(GAN)相比,VAE通常产生模糊样本,这归因于高斯噪声假设和KL正则化。当模型集中于数据分布的少数模式时,可能发生模式崩溃。近期进展通过分层VAE、归一化流和替代散度度量解决这些问题。截至2020年代中期,VAE仍是一个活跃研究领域,在Machine learningGenerative AI方面持续工作以改善样本质量和可扩展性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-models·variational-bayesian-methods·neural-network-architectures·unsupervised-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史