2020年的研究论文《去噪扩散概率模型》由Jonathan Ho、Ajay Jain和Pieter Abbeel撰写,介绍了一种实用且高质量的生成建模方法,利用扩散过程实现。基于2015年非平衡热力学的早期工作,该论文提出了一个特定框架,称为去噪扩散概率模型(DDPM)。在机器学习中,扩散模型是一类潜变量生成模型,通过学习逆转逐渐加噪的过程来生成新数据。它们已成为现代生成式AI的核心,特别是在图像生成领域,与深度学习的其他方法并驾齐驱。
扩散模型的核心思想分为两部分:前向扩散过程逐步向数据添加噪声(直到数据类似于纯高斯噪声),以及反向采样过程学习去除噪声,恢复原始数据分布。训练好的模型可以通过从随机噪声开始并迭代去噪来生成新样本。2020年的论文提出了DDPM,通过引入简化的变分下界和特定参数化,改进了早期方法。
概念与形式化
扩散模型是一类潜变量模型,将数据建模为通过扩散过程生成 - 即在可能数据点空间中的带漂移随机游走。前向过程是一个马尔可夫链,在T步中添加高斯噪声,通常使用常数β_t的时间表。反向过程也是一个马尔可夫链,由神经网络参数化,学习预测每一步添加的噪声。模型使用变分推断训练,采用简单的均方误差损失。
DDPM论文的一个关键创新是展示了训练目标简化为加权均方误差项,将模型预测的噪声与实际噪声匹配。论文还确定,没有额外加权项的更简单目标在实践中效果良好。反向扩散模型,通常称为“骨干网络”,可以是任何网络,典型的是U-Net或transformer。对于图像,骨干网络通常是U-Net变体,迭代应用于去噪图像样本。
DDPM的工作原理
前向扩散过程由一系列噪声水平β_1,...,β_T定义,其中α_t = 1 − β_t,ᾱ_t为累积乘积。在每一步t,向图像添加高斯噪声。一个关键洞见是,经过t步后,噪声图像可以直接表示为原始图像和高斯噪声的组合,从而允许在随机时间步高效训练。反向过程随后学习估计添加的噪声,使原始数据得以恢复。
在DDPM中,训练涉及随机选择时间步,并最小化比较噪声预测网络输出与实际高斯噪声的损失。在采样过程中,模型从纯高斯噪声开始,迭代应用学习到的反向过程。论文还指出,时间步的简单均匀加权效果最佳,且早期阶段在反向过程中较慢。
影响
该方法成为许多后续扩散模型的基础。它在CIFAR-10和LSUN等数据集上展示了高质量的图像生成,挑战了当时占主导地位的生成对抗网络。此后,扩散模型在生成式AI和机器学习中被广泛采用,促成了DALL-E和Stable Diffusion等商业系统,这些系统将扩散模型与文本编码器和交叉注意力结合,用于文本条件生成。骨干网络通常是transformer和U-Net的混合体,一些模型使用Transformer作为骨干。
遗产与影响
2020年的论文催化了生成式AI发展的转变。在扩散模型之前,生成对抗网络主导了图像生成,但DDPM在样本质量和训练稳定性上超越了它们。截至2024年,扩散模型主要用于图像去噪、修复、超分辨率、图像生成和视频生成等任务。它们也被应用于其他领域,包括文本生成、声音生成和强化学习。
该论文的方法已被后续研究扩展,如快速采样方法、潜扩散模型和文本到图像系统。其成功促进了巨大的商业兴趣,相关工具现已集成到硬件和软件产品中。物理学(非平衡热力学、布朗运动)与现代AI之间的桥梁证明了学术研究的价值。