2020年研究论文《去噪扩散概率模型》由Jonathan Ho、Ajay Jain和Pieter Abbeel撰写,提出了一种实用且高质量的生成建模方法,基于扩散过程。该论文在2015年非平衡热力学早期工作的基础上,提出了一个名为去噪扩散概率模型(DDPM)的特定框架。在机器学习中,扩散模型是一类潜变量生成模型,通过学习逆转逐步加噪过程来生成新数据。它们已成为现代生成式AI的核心,尤其在图像生成领域,与深度学习中的其他方法并列。
扩散模型的核心思想分为两部分:前向扩散过程逐步向数据添加噪声(直到其接近纯高斯噪声),以及反向采样过程学习去除噪声,恢复原始数据分布。训练后的模型可以从随机噪声开始,通过迭代去噪生成新样本。2020年论文提出的DDPM通过引入简化的变分下界和特定参数化,改进了早期方法。
概念与形式化
扩散模型是一类潜变量模型,将数据建模为由扩散过程生成,即通过可能数据点空间中的带漂移随机游走。前向过程是一个马尔可夫链,在T步中逐步添加高斯噪声,通常使用常数β_t的调度。反向过程也是一个马尔可夫链,由神经网络参数化,学习预测每一步添加的噪声。模型使用变分推断训练,采用简单的均方误差损失。
DDPM论文的一个关键创新在于表明训练目标可简化为加权均方误差项,将模型预测的噪声与实际噪声匹配。论文还指出,无需额外加权项的更简单目标在实践中效果良好。反向扩散模型通常称为“骨干网络”,可以是任何网络,典型为U-Net或transformer。对于图像,骨干网络通常是U-Net变体,迭代应用于去噪图像样本。
DDPM的工作原理
前向扩散过程由一系列噪声水平β_1,...,β_T定义,其中α_t = 1 − β_t,ᾱ_t为累积乘积。在每一步t,向图像添加高斯噪声。一个关键洞见是,经过t步后,带噪图像可直接表示为原始图像与高斯噪声的组合,从而允许在随机时间步进行高效训练。反向过程随后学习估计添加的噪声,从而恢复原始数据。
在DDPM中,训练涉及随机选择时间步,并最小化比较噪声预测网络输出与实际高斯噪声的损失。在采样过程中,模型从纯高斯噪声开始,迭代应用学习到的反向过程。论文还指出,时间步上的简单均匀加权效果最佳,且反向过程中早期阶段较慢。
影响
该方法成为许多后续扩散模型的基础。它在CIFAR-10和LSUN等数据集上展示了高质量图像生成,挑战了当时占主导地位的生成对抗网络。此后,扩散模型在Generative AI和Machine learning中被广泛采用,催生了DALL-E和Stable Diffusion等商业系统,这些系统将扩散模型与文本编码器和Cross-Attention结合,用于文本条件生成。骨干网络通常是transformer和U-net的混合体,有些模型使用Transformer (architecture)作为骨干。
遗产与影响
2020年论文催化了Generative AI发展的转变。在扩散模型之前,生成对抗网络主导图像生成,但DDPM在样本质量和训练稳定性上超越了它们。截至2024年,扩散模型主要用于图像去噪、修复、超分辨率、图像生成和视频生成等任务。它们也被应用于其他领域,包括文本生成、声音生成和强化学习。
该论文的方法已被后续研究扩展,如快速采样方法、潜扩散模型和文本到图像系统。其成功促成了巨大的商业兴趣,相关工具现已集成到硬件和软件产品中。物理学(非平衡热力学、布朗运动)与现代AI之间的桥梁,是学术研究的见证。