译自英文

DDIM(去噪扩散隐式模型)是一类生成模型,通过隐式概率模型加速扩散采样,从而在更少的步骤内实现更快速的高质量图像生成,同时保持确定性映射。

去噪扩散隐式模型(DDIM)是一类生成模型,由斯坦福大学的Jiaming Song、Chenlin Meng和Stefano Ermon于2021年提出。它们通过将采样过程重新定义为隐式概率模型,扩展了扩散模型框架,使得从训练好的扩散模型中生成高质量样本的速度更快,且无需额外训练或修改底层网络。DDIM解决了标准扩散模型的一个关键限制:生成单张图像通常需要数千次迭代去噪步骤的缓慢采样过程。通过将反向过程构建为非马尔可夫链,DDIM使得同一训练模型能够以大幅减少的步骤进行采样,通常减少10到50倍,同时保持具有竞争力的输出质量。

DDIM的核心创新在于对扩散过程前向和反向转移的重新表述。标准去噪扩散概率模型(DDPM)假设一个马尔可夫链,其中每一步仅依赖于前一个状态,因此需要大量步骤才能从高斯噪声中重建出干净的样本。DDIM则观察到,扩散模型的训练目标与更广泛的非马尔可夫前向过程族一致,这些过程可以被设计为允许确定性或半确定性的反向过程。通过用自由变量参数化这些过程,DDIM构建了一类生成模型,它们产生相同的训练损失,但具有更灵活的采样轨迹。这允许从噪声到数据的确定性映射,从而以直接且可重现的方式生成样本,这一特性在原始随机公式中是不存在的。

这种非马尔可夫视角的实际好处是能够使用减少的时间步调度进行采样。虽然DDPM通常使用1000到2000个去噪步骤,但DDIM在许多情况下仅用20、50或100步就能生成有效图像。模型的架构组件与DDPM中的完全相同,,一个神经网络,通常是带有注意力层的U-Net,在每一步预测噪声分量。区别在于概率过程,它允许在去噪器调度中跳过中间步骤而不会引入重大重建误差。因此,DDIM在采样速度和样本保真度之间提供了权衡;较高的步数产生高精度,而较低的步数牺牲一些质量但保持视觉连贯性。这种灵活性可用于推理时引导等任务,其中同一模型可以在不同调度下生成多样化的样本。

除了速度之外,DDIM还实现了潜在噪声与生成数据之间的确定性和可逆映射。这一特性支持噪声空间中的插值,其中在潜在空间中对两个样本进行线性插值会在生成的图像空间中产生语义上有意义的变形。这种确定性特性还允许像生成对抗训练模型那样进行采样,用于图像编辑、修复或从部分观测中重建等任务,而无需训练GAN的相关不稳定性。隐式模型视角还将DDIM置于更广泛的隐式概率模型家族中,这些模型通过简单的确定性生成函数定义分布,与变分推断和归一化流的概念相关联。

DDIM的算法发展促进了高效扩散式Generative AI的更广泛演进。其采样公式通常写为预测噪声与当前样本的线性组合,并带有缩放系数,成为后来处理潜在扩散、文本到图像合成和高分辨率生成的工作的构建块。DDIM是多个参考实现中广泛使用的去噪采样器,包括与Stable Diffusion模型相关的那些,,其步长跳过策略和确定性公式仍然是该领域后续工作的比较标准,例如去噪扩散GAN和一致性模型。

与扩散概率模型的关系

DDIM建立在扩散概率模型提供的理论基础之上,特别是Sohl-Dickstein等人(2015年)和Diederik Ho等人(2020年)的工作。标准DDPM在1000步内用高斯噪声随机扰动数据,并通过估计噪声来学习逆转这一过程。虽然有效,但从DDPM采样时,每一步反向过程都会抽取新的随机噪声样本。DDIM则定义了一族前向过程,使得反向过程可以近似确定性。一个关键的理论见解是,损失函数仅涉及反向过程与前向过程之间的KL散度,该散度被选择为依赖于分数估计器;替代的前向过程是可能的,而不影响训练,从而在采样中提供了灵活性。DDIM随后构建“隐式”链以匹配这些统计边际,从而产生新的采样规则。

这种灵活性的直接后果是,DDIM是一个独立的模型家族,但相同的训练过程适用于两者。用户必须保留相同的网络,但在采样时,可以根据时间限制选择使用DDPM调度或DDIM调度。DDIM公式的参数由噪声的alpha(α)和sigma(σ)调度决定,这些通常被预计算为扩散系数。DDIM的核心方程将预测的去噪样本(x0)和当前潜在变量(xt)关联起来,以使用公式生成下一个潜在变量x(t-1):x(t-1) = sqrt(α(t-1)) x0 + sqrt(1 - α(t-1) - σ(t)^2) ε_θ(xt) + σ(t) z,其中z是可选噪声,ε是噪声预测。当σ设置为零时,过程完全确定性,产生一个称为“非齐次”DDIM的家族,对应于确定性退火朗之万动力学。

这项工作起源于BAIR (Berkeley AI Research)(以Song和Ermon的隶属关系形式,尽管他们当时在斯坦福大学),并与早期的基于分数的生成模型和无噪声网络相关。DDIM公式也与Neural network分数函数逼近器密切相关,因为噪声预测器是高斯分布,其目标是估计分数项,确保扩散步骤的反向捕获数据流形。

优势与局限性

DDIM的实际好处包括采样时的可控性、可重现性(因为随机种子对应于输入潜在变量)和可外推性。它基于固定数量的去噪步骤提供图像的有效联合估计,使得同一模型可以在资源受限的硬件上使用。然而,DDIM基于每一步高斯误差的假设;在实践中,有限步近似限制了与完整SDE采样器相比的质量。因此,在中低步数下性能明显下降,对于极少数步骤会产生严重伪影,导致变形解剖结构或模糊。尽管如此,在Large language model相关的文本到图像模型时代,确定性递减特性对于在Deep learning推理期间构建采样管道很有用。

显式去噪机制也有助于构建DDPM衍生物的常见架构,例如Stable Diffusion和高分辨率图像合成中使用的去噪扩散隐式模型。稳定扩散方法使用缩减的潜在空间和DDIM采样器作为该潜在核心中反向扩散的高效求解器。这构成了广泛使用的diffusers(库)包的基础,DDIM的实际代码通常与所有其他扩散模型捆绑在一起,使其可访问性很高。

采样速度与质量权衡

DDIM接受一个小而可管理的两步调度,这在原始扩散的标准上。步数是一个超参数,可以在推理时调整以平衡样本质量。在20步时,DDIM能够在许多情况下产生与1000步DDPM质量相似的图像,但如果减少到10步,则会产生更明显的视觉伪影,如模糊区域。在特定模块中使用DDIM,例如潜在扩散模型中的锐利采样器,仍然使用50步以达到有竞争力的指标。调度通常如何从初始噪声遍历到输出,,例如,起始潜在变量与最终平均噪声之间的直线插值?,,输出往往在早期和晚期步骤中质量中等。

与使用自适应采样调度的方法(如AlignSAM ArrayList或Conclément隐式方法)相比,DDIM不重新训练网络,而是训练去噪器,与分类器相同,并且所提出的方法能够获得良好结果。

影响与相关工作

在2021年国际学习表征会议(ICLR)上发表后,DDIM对更广泛的生成建模领域产生了影响。它引入了扩散过程确定性采样的概念,这对于理解潜在变量空间至关重要,并使扩散模型能够用于下游任务,如潜在扩散模型(Rombach等人,2022年),这些模型基于嵌入的ID和DDIM采样器锁定。许多后续文章在“Fisher合并”和“作者”中引用了该方法。训练目标与DDPM相同,但其样本处理导致更好的GAN风格潜在变量。DDIM中的反向方法也已用于图像到图像转换和后验家族,这在逆设置中是已知的。

这些发现的存在为强大的采样算法铺平了道路,例如DPM-solver(2022年),这是一种使用积分分析的确定性方法,以及去噪扩散GAN模型(2022年),用于通过对抗步骤建模步骤过程。这些现代方法通常将DDIM基础与连续测试相结合,有时在一次迭代中获得样本。非马尔可夫视角的哲学也是后续模型改进的方式。DDIM的确定性动力学是当今AI系统实验室中的重要工具,例如在LangChain中。

此外,隐式概率模型的理论研究与流和修正流相关联,这些在计算机引擎中用作设计工具。该论文被高度引用,被评为开源AI领域生成视频效果部分的基础论文之一。

总体而言,DDIM的重要性在于其高步数、优雅性以及计算与实践之间的桥梁作用。它使高质量生成对多样化用户可访问,并且仍然是任何现代文本到图像或基于扩散的管道中的标准样本,包括来自Google DeepMind相关、OpenAI相关的稳定字典和Adobe的管道。对于2025年的所有实际(内部)用途,DDIM被用作经典采样引擎。

来源

  • Song等人,2021年,“去噪扩散隐式模型”(在线预印本)
  • Ho等人,2020年,“去噪扩散概率模型”
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·diffusion-models·deep-learning·image-generation
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史