अंग्रेज़ी से अनुवादित

जोनाथन हो एट अल. द्वारा 2020 का पेपर डिनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) पेश करता है, जो जनरेटिव मॉडल का एक वर्ग है जो क्रमिक नॉइज़िंग प्रक्रिया को उलटना सीखता है। यह डिफ्यूज़न-आधारित AI छवि निर्माण के लिए आधारभूत बन गया।

2020年的研究论文《去噪扩散概率模型》由Jonathan Ho、Ajay Jain和Pieter Abbeel撰写,介绍了一种实用且高质量的生成建模方法,利用扩散过程实现。基于2015年非平衡热力学的早期工作,该论文提出了一个特定框架,称为去噪扩散概率模型(DDPM)。在机器学习中,扩散模型是一类潜变量生成模型,通过学习逆转逐渐加噪的过程来生成新数据。它们已成为现代生成式AI的核心,特别是在图像生成领域,与深度学习的其他方法并驾齐驱。

扩散模型的核心思想分为两部分:前向扩散过程逐步向数据添加噪声(直到数据类似于纯高斯噪声),以及反向采样过程学习去除噪声,恢复原始数据分布。训练好的模型可以通过从随机噪声开始并迭代去噪来生成新样本。2020年的论文提出了DDPM,通过引入简化的变分下界和特定参数化,改进了早期方法。

概念与形式化

扩散模型是一类潜变量模型,将数据建模为通过扩散过程生成 - 即在可能数据点空间中的带漂移随机游走。前向过程是一个马尔可夫链,在T步中添加高斯噪声,通常使用常数β_t的时间表。反向过程也是一个马尔可夫链,由神经网络参数化,学习预测每一步添加的噪声。模型使用变分推断训练,采用简单的均方误差损失。

DDPM论文的一个关键创新是展示了训练目标简化为加权均方误差项,将模型预测的噪声与实际噪声匹配。论文还确定,没有额外加权项的更简单目标在实践中效果良好。反向扩散模型,通常称为“骨干网络”,可以是任何网络,典型的是U-Net或transformer。对于图像,骨干网络通常是U-Net变体,迭代应用于去噪图像样本。

DDPM的工作原理

前向扩散过程由一系列噪声水平β_1,...,β_T定义,其中α_t = 1 − β_t,ᾱ_t为累积乘积。在每一步t,向图像添加高斯噪声。一个关键洞见是,经过t步后,噪声图像可以直接表示为原始图像和高斯噪声的组合,从而允许在随机时间步高效训练。反向过程随后学习估计添加的噪声,使原始数据得以恢复。

在DDPM中,训练涉及随机选择时间步,并最小化比较噪声预测网络输出与实际高斯噪声的损失。在采样过程中,模型从纯高斯噪声开始,迭代应用学习到的反向过程。论文还指出,时间步的简单均匀加权效果最佳,且早期阶段在反向过程中较慢。

影响

该方法成为许多后续扩散模型的基础。它在CIFAR-10和LSUN等数据集上展示了高质量的图像生成,挑战了当时占主导地位的生成对抗网络。此后,扩散模型在生成式AI和机器学习中被广泛采用,促成了DALL-E和Stable Diffusion等商业系统,这些系统将扩散模型与文本编码器和交叉注意力结合,用于文本条件生成。骨干网络通常是transformer和U-Net的混合体,一些模型使用Transformer作为骨干。

遗产与影响

2020年的论文催化了生成式AI发展的转变。在扩散模型之前,生成对抗网络主导了图像生成,但DDPM在样本质量和训练稳定性上超越了它们。截至2024年,扩散模型主要用于图像去噪、修复、超分辨率、图像生成和视频生成等任务。它们也被应用于其他领域,包括文本生成、声音生成和强化学习。

该论文的方法已被后续研究扩展,如快速采样方法、潜扩散模型和文本到图像系统。其成功促进了巨大的商业兴趣,相关工具现已集成到硬件和软件产品中。物理学(非平衡热力学、布朗运动)与现代AI之间的桥梁证明了学术研究的价值。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·machine-learning·research-paper·diffusion-models
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास