译自英文

扩散模型是一种生成模型,通过学习逆转逐步加噪的过程来生成数据,并且是大多数现代文生图和文生视频系统的核心技术。

扩散模型是一种生成模型,通过学习逆转逐步加噪的过程来创建数据,最常见的是图像、视频或音频:它被训练为逐步从损坏的样本中去除噪声,一旦训练完成,便可以从纯随机噪声出发,通过迭代去噪生成连贯的输出。截至2020年代中期,扩散模型是大多数领先的文本到图像文本到视频系统背后的技术,已取代生成对抗网络成为高保真图像合成的主导方法。

历史

理论基础由Jascha Sohl-Dickstein及其同事在2015年的一篇论文中奠定,该论文借用了非平衡热力学的类比,描述了一个用噪声逐步破坏数据结构然后学习逆转该过程的方法。这一方法最初仅是研究上的新奇事物,直到Jonathan Ho、Ajay Jain和Pieter Abbeel在2020年发表了《去噪扩散概率模型》(DDPM),表明一个相对简单的训练目标就能产生与GAN相媲美的图像质量。该技术通过OpenAI的DALL-E 2于2022年4月进入主流视野,并在几个月后随着2022年8月Stable Diffusion的开源发布而广泛可用,后者基于潜在扩散,这是Robin Rombach及其同事在2022年引入的技术,在压缩的潜在空间中运行去噪过程,而非直接在原始像素上操作,从而大幅降低了训练和运行扩散模型所需的计算量。

工作原理

训练扩散模型涉及一个前向过程,该过程在多个步骤中向真实数据样本添加少量高斯噪声,直到其变得与纯噪声无法区分;同时,一个神经网络(通常是U-Net,或越来越多地采用基于Transformer的架构)被训练来预测并移除每一步添加的噪声,从而有效学习逆向过程。生成过程从头开始运行这一逆向过程:从随机噪声出发,模型在多个步骤中反复预测并减去噪声,逐步揭示出连贯的图像或视频。条件机制(最常见的是通过编码文本提示,并经由交叉注意力将其输入去噪网络)让用户能够引导模型生成的内容,而诸如无分类器引导等技术则增强了输出与该条件信号的吻合程度。

应用与生态系统

扩散模型驱动着几乎所有广泛使用的主流图像生成器,包括Stable DiffusionDALL-E、Midjourney和Flux,并支撑着Sora、谷歌的Veo以及Kling和Seedance等中国系统在内的领先视频生成器。诸如2023年推出的ControlNet等扩展增加了结构条件,让用户能够通过草图、姿态或深度图引导生成,而围绕开放检查点构建的生态系统则通过社区训练的LoRA适配器等技术支持广泛的定制化。扩散技术也被应用于媒体生成之外的领域,包括蛋白质结构预测和分子设计;研究人员还探索了基于扩散的文本生成方法,作为大多数大型语言模型采用的逐词自回归方法的替代方案,尽管截至2025年,自回归生成在文本领域仍占主导地位。

局限性

与GAN相比,扩散模型在推理时计算成本较高,因为生成单个样本可能需要数十或数百个顺序去噪步骤,尽管自2022年以来,蒸馏为少步模型和改进采样器等技术已大幅降低了这一成本。在大型、未经整理的网络抓取数据集上训练的扩散模型也面临人工智能版权争议,即生成与训练数据中艺术家风格相似或类似的图像是否构成侵权,并因其在某些条件下能够逐字复现记忆中的训练图像而受到审查。

分类:deep-learning·generative-ai·image-generation
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史