DDPM(去噪扩散概率模型)

译自英文

去噪扩散概率模型(DDPMs)是一类生成模型,它们学习逆转逐步加噪的过程以生成数据,广泛用于图像生成。该模型于2020年提出,通过变分推断改进了早期的扩散方法。

去噪扩散概率模型(DDPM)是一类生成模型,通过学习逆转逐步加噪的过程来生成数据。它们属于更广泛的扩散模型家族,这类模型将数据视为在高维空间中带有漂移的随机游走。DDPM 于 2020 年在一篇论文中提出,该论文改进了早期基于变分推断的扩散方法,并成为许多现代图像生成系统的基础。

在 DDPM 中,前向过程会在多个时间步上向图像添加高斯噪声,逐步将其转化为纯噪声。模型被训练来逆转这一过程,从随机噪声开始,通过迭代去噪生成逼真的图像。这种方法在图像生成、修复和超分辨率等任务中已被证明非常有效,并为Stable Diffusion和DALL E等商业系统提供了底层支撑。

核心机制

DDPM 框架定义了一个具有固定噪声水平调度表的前向扩散过程。对于给定图像,每一步都会根据方差调度表添加噪声,从而产生一系列越来越嘈杂的版本。逆向过程由一个神经网络(通常是 U-Net 或Transformer)学习,该网络预测每一步的噪声分量。训练时最小化预测噪声与实际噪声之间的简单均方误差,这等价于一种变分推断形式。

在数学上,前向过程使用常数 \(\beta_1, \dots, \beta_T\)(取值在 (0,1) 内),其中 \(\alpha_t = 1 - \beta_t\),且 \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\)。时间步 \(t\) 处的带噪图像是原始图像与高斯噪声的线性组合,其方差为 \(\sigma_t^2 = 1 - \bar{\alpha}_t\)。逆向过程由一个神经网络参数化,该网络输出去噪分布的均值。

训练与采样

训练 DDPM 涉及采样一个随机时间步,向图像添加相应的噪声,并训练网络预测该噪声。损失函数为 \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\),其中 \(\epsilon\) 是噪声,\(\epsilon_\theta\) 是网络的预测。该目标函数源自对数似然的变分下界。

在采样时,模型从纯高斯噪声开始,迭代应用逆向过程 \(T\) 次,每次去除一部分噪声。可以通过诸如去噪扩散隐式模型(DDIM)等技术或学习噪声调度表来减少步数,从而实现更快的生成。

历史背景

扩散模型最早由 Jascha Sohl-Dickstein 等研究人员于 2015 年提出,其原理借鉴了非平衡热力学。他们证明,复杂的数据分布可以逐步扩散为简单的高斯分布,而学习逆转这一过程可以生成新的样本。然而,早期方法计算成本高昂,且在当时的效果不如GAN。

2020 年的 DDPM 论文由 Jonathan Ho、Ajay Jain 和Pieter Abbeel撰写,证明了只要精心选择噪声调度表并使用 U-Net 作为骨干网络,扩散模型就能达到最先进的图像生成质量。这引发了研究和应用的迅速扩展。

应用与影响

截至 2024 年,DDPM 及其变体已广泛用于计算机视觉任务,如图像去噪、修复、超分辨率和文生图。它们也被应用于自然语言处理中的文本生成和摘要,以及音频生成领域。Stable Diffusion和DALL E等商业产品将 DDPM 与文本编码器和交叉注意力模块相结合,实现了基于文本条件的生成,使其面向更广泛的受众。

DDPM 还影响了其他领域,包括强化学习和科学模拟,在这些领域中它们被用于建模复杂分布。它们生成高质量样本的能力使其成为现代人工智能研究的基石。

局限性与未来方向

尽管取得了成功,DDPM 仍存在局限性。由于迭代去噪过程,其采样速度通常慢于 GAN,不过目前已开发出加速方法。它们还需要大量的计算资源进行训练,这推动了对高效架构和硬件(如AWS Trainium和Google Cloud TPU)的兴趣。持续的研究重点在于提高样本质量、缩短推理时间,并将 DDPM 扩展到新的模态。

截至 2025 年,扩散模型仍是一个活跃的研究领域,在骨干架构、噪声调度表和条件机制方面的创新不断推动着生成建模可能性的边界。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·machine-learning·computer-vision·deep-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史