Denoising Diffusion Implicit Models(DDIM)是一类生成模型,由斯坦福大学的Jiaming Song、Chenlin Meng和Stefano Ermon于2021年提出。它们通过将采样过程重新定义为隐式概率模型,扩展了扩散模型框架,从而无需额外训练或修改底层网络,即可从训练好的扩散模型中更快地生成高质量样本。DDIM解决了标准扩散模型的一个关键局限性:生成单张图像通常需要数千次迭代去噪步骤的缓慢采样过程。通过将反向过程构建为非马尔可夫链,DDIM使得同一训练好的模型能够以大幅减少的步骤进行采样,通常减少10到50倍,同时保持具有竞争力的输出质量。
DDIM的核心创新在于对扩散过程前向和反向转换的重新表述。标准去噪扩散概率模型(DDPM)假设一个马尔可夫链,其中每一步仅依赖于前一步的状态,因此需要大量步骤才能从高斯噪声中重建出干净的样本。DDIM则观察到,扩散模型的训练目标与更广泛的非马尔可夫前向过程族相一致,这些过程可以被设计为允许确定性或半确定性的反向过程。通过使用自由变量对这些过程进行参数化,DDIM构建了一类生成模型,其训练损失相同,但采样轨迹更加灵活。这使得从噪声到数据的确定性映射成为可能,从而以直接且可复现的方式生成样本,这是原始随机公式所不具备的特性。
这种非马尔可夫视角的实际益处在于能够使用缩减的时间步调度进行采样。虽然DDPM通常使用1000到2000个去噪步骤,但DDIM在许多情况下仅需20、50或100个步骤即可生成有效的图像。模型的架构组件与DDPM保持相同、、通常是一个带有注意力层的U-Net,用于预测每个步骤的噪声分量。区别在于概率过程,它允许在去噪调度中跳过中间步骤而不会引入重大重建误差。因此,DDIM在采样速度与样本保真度之间提供了权衡;较高的步数产生较高的精度,而较低的步数虽牺牲部分质量但仍保持视觉连贯性。这种灵活性可用于推理时引导等任务,其中同一模型可以在不同调度下生成多样化的样本。
除了速度之外,DDIM还实现了潜在噪声与生成数据之间的确定性和可逆映射。这一特性支持噪声空间中的插值,其中潜在空间中两个样本之间的线性插值会在生成的图像空间中产生语义上有意义的变形。这种确定性特性还允许像生成对抗训练模型那样进行采样,适用于图像编辑、修复或从部分观测中重建等任务,而无需承担训练GAN时的不稳定性。隐式模型视角还将DDIM置于更广泛的隐式概率模型家族中,这些模型通过简单的确定性生成函数定义分布,与变分推断和归一化流的概念相关联。
DDIM的算法发展促进了基于扩散的生成式AI的更广泛演进。其采样公式通常写为预测噪声与当前样本的线性组合并带有缩放系数,成为后续研究的基础构件,这些研究涉及潜在扩散、文本到图像合成以及高分辨率生成。DDIM是多个参考实现中广泛使用的去噪采样器,包括与Stable Diffusion模型相关的实现、、其跳步策略和确定性公式仍然是该领域后续工作的比较标准。
与扩散概率模型的关系
DDIM建立在扩散概率模型提供的理论基础之上,特别是Sohl-Dickstein等人(2015年)和Diederik Ho等人(2020年)的工作。标准DDPM通过超过1000步向数据中添加高斯噪声,并学习通过估计噪声来逆转这一过程。虽然有效,但DDPM的采样在每个反向步骤中都会抽取新的随机噪声样本。DDIM则定义了一族前向过程,使得反向过程可以近似为确定性过程。一个关键的理论洞见是,损失函数仅涉及反向过程与前向过程之间的KL散度,该散度被选择为依赖于得分估计器;因此可以选择替代的前向过程而不影响训练,从而在采样时提供灵活性。DDIM随后构建了“隐式”链以匹配这些统计边际,产生了一种新的采样规则。
这一灵活性的直接结果是,DDIM是一个独立的模型家族,但相同的训练流程适用于两者。用户必须保持相同的网络,但在采样时,可以根据时间约束选择使用DDPM调度或DDIM调度。DDIM公式中的参数由噪声的alpha(α)和sigma(σ)调度决定,这些通常被预计算为扩散系数。DDIM的核心方程将预测的去噪样本(x0)与当前潜在变量(xt)关联起来,以生成下一个潜在变量x(t-1),公式为:x(t-1) = sqrt(α(t-1)) x0 + sqrt(1 - α(t-1) - σ(t)^2) ε_θ(xt) + σ(t) z,其中z是可选的噪声,ε是噪声预测。当σ设置为零时,该过程完全确定性,产生一个称为“非齐次”DDIM的家族,对应于确定性退火朗之万动力学。
这项工作起源于伯克利AI研究(以Song和Ermon的隶属关系形式,尽管他们当时在斯坦福大学),并与早期的基于得分的生成模型和无噪声网络相关。DDIM的公式化也与神经网络得分函数逼近器密切相关,因为噪声预测器是高斯分布,其目标是估计得分项,确保扩散反向步骤捕获数据流形。
优势与局限性
DDIM的实际优势包括采样时间可控性、可复现性(因为随机种子决定了输入潜在变量)以及外推能力。它基于固定数量的去噪步骤提供了有效的联合估计,使得同一模型能够在资源受限的硬件上使用。然而,DDIM基于每一步高斯误差的假设;在实践中,有限步数近似会限制与完整SDE采样器相比的质量。因此,在中等到低步数下性能会明显下降,在极少数步骤下会出现严重伪影,导致图像变形或模糊。尽管如此,在大语言模型相关的文本到图像模型时代,DDIM的确定性递减特性对于在深度学习推理期间构建采样流程仍然非常有用。
DDIM的显式去噪机制也有助于构建DDPM衍生模型的通用架构,例如用于Stable Diffusion和高分辨率图像合成的Denoising Diffusion Implicit Models。Stable Diffusion方法使用缩减的潜在空间,并将DDIM采样器作为该潜在核心中反向扩散的高效求解器。这构成了广泛使用的diffusers(库)包的基础,DDIM的实际代码通常与所有其他扩散模型捆绑在一起,使其具有很高的可访问性。
采样速度与质量权衡
DDIM接受一个较小且易于管理的两步调度,该调度基于原始扩散的标准。步数是一个超参数,可以在推理时调整以平衡样本质量。在许多情况下,20步的DDIM能够生成与1000步DDPM质量相当的图像,但如果减少到10步,则会产生更明显的视觉伪影,例如模糊区域。DDIM在潜在扩散模型的特定模块中的使用,例如从潜在扩散模型中的锐利采样器,仍然保持50步以达到有竞争力的指标。调度通常涉及如何从初始噪声遍历到输出、、例如,在起始潜在变量和最终平均噪声之间进行直线插值、、输出在早期和晚期步骤中往往具有中等质量。
与使用自适应采样调度器的方法(例如AlignSAM ArrayList或Conclément implicits)相比,DDIM不需要重新训练网络,而是直接训练去噪器,类似于分类器,并且所提出的方法能够获得良好的结果。
影响与相关工作
在2021年国际学习表征会议(ICLR)上发表后,DDIM对更广泛的生成建模领域产生了影响。它引入了扩散过程确定性采样的概念,这对于理解潜在变量空间至关重要,并使扩散模型能够用于下游任务,如潜在扩散模型(Rombach等人,2022年),这些模型基于嵌入的ID锁定并使用DDIM采样器。许多后续文章引用了“Fisher合并”和“作者”中的方法。其训练目标与DDPM相同,但其样本处理方式带来了更好的GAN风格潜在表示。DDIM中的反向方法也已被用于图像到图像转换以及后验分布家族,这在逆问题设置中是已知的。
这些发现的存在为强大的采样算法铺平了道路,例如DPM-solver(2022年),这是一种使用积分分析的确定性方法,以及去噪扩散GAN模型(2022年),该模型使用对抗步骤对逐步过程进行建模。这些现代方法通常将DDIM基础与连续测试相结合以收敛,有时仅需一次迭代即可获得样本。非马尔可夫视角的理念也是后续模型改进的方式。DDIM的确定性动力学是当今AI系统实验室中的重要工具,例如在LangChain中经常使用。
此外,隐式概率模型的理论研究与流和修正流相关联,这些被用作计算机引擎中的设计工具。该论文被高度引用,被评为开源AI领域生成视频效果部分的基础论文之一。
总体而言,DDIM的重要性在于其高步数效率、优雅性以及计算与实践之间的桥梁作用。它使高质量生成对多样化用户群体变得可及,并且仍然是任何现代文本到图像或基于扩散的流程中的标准采样器,包括来自Google DeepMind相关、OpenAI相关的稳定词典和Adobe的流程。对于2025年的所有实际(内部)用途,DDIM被用作经典采样引擎。
来源
- Song等人,2021年,“Denoising Diffusion Implicit Models”(在线预印本)
- Ho等人,2020年,“Denoising Diffusion Probabilistic Models”