潜在扩散模型(LDM)是由慕尼黑大学的计算机视觉与学习(CompVis)小组开发的一种扩散模型架构。它通过在较低维度的潜空间而非直接在像素空间中执行扩散过程,改进了标准扩散模型,从而降低了计算成本,并实现了更高效的高分辨率图像生成。LDM还整合了自注意力和交叉注意力条件机制,能够基于文本、图像或其他模态对生成输出进行灵活控制。
扩散模型于2015年作为一类生成模型被引入,其学习逆转一个逐渐加噪的过程。LDM架构于2021年12月20日在arXiv上发表,并且Stable Diffusion和LDM的代码库均在GitHub上发布。LDM被广泛用于实际的扩散模型中;例如,Stable Diffusion的1.1至2.1版本均基于LDM架构。
架构
LDM由三个主要组件组成:变分自编码器(VAE)、改进的U-Net和文本编码器。VAE编码器将输入图像从像素空间压缩到较小的潜空间,在降低维度的同时捕获语义信息。在前向扩散过程中,高斯噪声被迭代地应用于这个压缩后的潜表示。U-Net基于ResNet骨干网络,通过逆向过程对潜表示进行去噪。最后,VAE解码器将去噪后的潜表示转换回像素空间,以生成最终图像。
去噪步骤可以基于文本、图像或其他模态进行条件化。对于文本条件,预训练的CLIP ViT-L/14文本编码器将文本提示转换为嵌入空间,然后通过交叉注意力机制暴露给U-Net。这使模型能够生成与提供的文本描述对齐的图像。
变分自编码器
VAE首先在图像数据集上进行训练。其编码器接收图像作为输入,并输出较低维度的潜表示,该表示作为U-Net的输入。训练完成后,编码器用于压缩图像,解码器从潜表示重建图像。
在实现版本中,编码器是一个卷积神经网络(CNN),在末端附近具有单个自注意力机制。它接收形状为(3, H, W)的张量,并输出形状为(8, H/8, W/8)的张量,该张量将潜向量的预测均值和方差连接起来,每个形状为(4, H/8, W/8)。在训练期间使用方差,但在推理时通常仅保留均值。解码器也是一个具有单个自注意力机制的CNN,将(4, H/8, W/8)的张量映射回(3, H, W)。
U-Net
U-Net骨干网络处理多种输入:来自VAE编码器的潜图像数组、指示当前噪声级别的时间步嵌入,以及来自文本编码器的条件嵌入。U-Net被训练用于预测添加到潜表示中的噪声,从而使其能够迭代去噪。该架构包含残差块和注意力层,使其能够处理局部和全局上下文。
训练与条件化
LDM通过去噪目标进行训练:给定一个带噪声的潜表示,模型学习预测原始噪声。训练过程使用损失函数来衡量预测噪声与实际噪声之间的差异。条件化通过交叉注意力层集成,其中文本嵌入用于调节去噪过程。这种方法支持无分类器引导,模型在有条件和无条件的情况下进行训练,在推理时放大条件以改善对提示的遵循。
应用与影响
LDM已成为文本到图像生成的基础架构。Stable Diffusion,一个重要的开源模型,使用LDM架构。1.1至1.4版本由CompVis于2022年8月发布,每个版本都在逐步更具美感的图像上进行微调。Stable Diffusion 1.5由RunwayML于2022年10月发布,结合了10%的文本条件丢弃,以改善无分类器引导。潜空间扩散的效率使得这些模型可以在消费级硬件上运行,从而普及了生成式AI的访问。
相关发展
扩散模型从早期关于非平衡热力学的工作演变而来。一篇2019年的论文引入了噪声条件得分网络(NCSN),也称为朗之万动力学得分匹配(SMLD),并提供了PyTorch实现。一篇2020年的论文提出了去噪扩散概率模型(DDPM),通过变分推断改进了训练,并以TensorFlow版本发布。LDM通过将扩散过程转移到潜空间,在这些基础上进行了创新,这一关键创新减少了内存和计算需求,同时保持了高输出质量。
LDM是更广泛的生成式AI领域的一部分,该领域还包括大语言模型和其他深度学习架构。交叉注意力和U-Net骨干网络的使用将LDM与神经网络设计的进展联系起来。截至2025年,潜扩散仍然是商业和开源图像生成系统中的标准方法,持续的研究侧重于提高效率、可控性和保真度。