潜在扩散模型(LDM)是一种生成模型,它通过在高维潜在空间而非像素空间中运行,扩展了扩散模型的框架。该模型由慕尼黑大学计算机视觉与学习(CompVis)小组开发,于2021年12月20日在arXiv上发表的论文中首次提出。LDM在降低计算成本的同时保持了高质量的图像生成能力,并支持通过自注意力机制和交叉注意力机制进行条件控制。LDM被广泛应用于实际扩散模型中;例如,Stable Diffusion 1.1至2.1版本均基于LDM架构。
LDM架构由三个主要组件构成:变分自编码器(VAE)、改进的U-Net和文本编码器。VAE将图像压缩到潜在空间,U-Net在该潜在空间中进行去噪处理,而文本编码器则提供条件信息。这种设计使得模型能够高效地从文本提示生成图像,使其成为现代AI图像生成的基石。
背景与发展
扩散模型于2015年首次被提出,作为一种利用非平衡热力学原理从复杂概率分布中采样的方法。2019年的一篇论文提出了噪声条件得分网络(NCSN),也称为基于朗之万动力学的得分匹配(SMLD),并在PyTorch中实现。2020年,去噪扩散概率模型(DDPM)利用变分推断改进了这些方法,并在TensorFlow中提供了参考实现。
LDM论文于2021年12月20日发表在arXiv上,Stable Diffusion和LDM的代码库均在GitHub上发布。该架构在Stable Diffusion 1.1至2.1版本采用后获得了广泛关注。Stable Diffusion 1.1在LAION-2B-en数据集上训练,后续版本通过微调提升了美学效果和分类器自由引导能力。Stable Diffusion 1.5由RunwayML于2022年10月发布。
架构概述
LDM在压缩的潜在空间中运行,这降低了数据的维度,从而加快了训练和推理速度。该过程首先由VAE编码器将输入图像从像素空间压缩为潜在表示。在前向扩散过程中,高斯噪声被迭代地添加到该潜在表示上。U-Net(由ResNet骨干网络组成)在逆向过程中对潜在表示进行去噪,最后VAE解码器将去噪后的潜在表示转换回像素空间。
去噪步骤可以基于多种模态进行条件控制,例如文本、图像或其他数据。对于文本条件控制,预训练的CLIP ViT-L/14文本编码器将文本提示转换为嵌入空间,并通过交叉注意力机制将其传递给U-Net。这使得模型能够生成与所提供的文本描述相符的图像。
变分自编码器
VAE在图像数据集上进行训练,以学习压缩的潜在表示。编码器接收形状为(3, 512, 512)的RGB图像,经过缩放因子0.18215处理后,输出形状为(4, 64, 64)的潜在张量,以大致白化潜在向量。解码器则执行相反过程,接收潜在张量并生成图像,使用缩放因子0.18125并将结果裁剪到[0, 1]范围。
编码器是一个卷积神经网络(CNN),在末端带有一个自注意力机制。它输出潜在向量的预测均值和方差(两者拼接在一起),每个的形状为(4, H/8, W/8)。在训练期间使用方差,但在推理时通常仅保留均值。解码器也是一个具有类似自注意力结构的CNN,将潜在张量转换回图像。
U-Net
U-Net骨干网络是核心去噪组件。它接收VAE编码器生成的潜在图像数组,以及文本嵌入等条件信息。U-Net被设计用于预测在前向扩散过程中添加的噪声,从而使模型能够迭代地去除噪声并恢复原始潜在表示。该架构包含残差连接和注意力机制,能够处理数据中的复杂依赖关系。
应用与影响
潜在扩散模型已成为许多文本到图像系统的基础,最著名的当属Stable Diffusion。在潜在空间中运行所带来的效率提升,使得这些模型能够在消费级硬件上运行,从而普及了AI图像生成技术。该架构还被应用于其他任务,如图像修复、超分辨率和视频生成,展现了其多功能性。
局限性与未来方向
尽管LDM取得了成功,但仍面临一些挑战,例如训练过程中的计算需求、生成内容中可能存在的偏见,以及对条件机制进行精细调优的必要性。相关研究持续推动架构改进,包括更高效的注意力机制和更好的潜在空间表示。截至2020年代初,LDM仍是机器学习和计算机视觉领域的重要研究方向,学术界和工业界实验室持续为其发展做出贡献。