离散扩散模型是一类作用于具有离散状态数据的生成模型,例如文本标记、分类变量或量化图像。与向实值数据添加高斯噪声的连续扩散模型不同,离散扩散模型应用结构化破坏过程(如随机标记掩蔽或转移概率),并学习逆转这些步骤以生成新样本。该方法已成为语言建模和离散图像生成等领域中自回归模型的重要替代方案。
该概念建立在更广泛的扩散模型框架之上,扩散模型于2010年代初首次针对连续数据形式化,并在2015年随着去噪扩散概率模型(DDPM)的引入而受到重视。离散变体是为处理固有离散数据而开发的,无需连续嵌入,从而产生了多项式扩散和基于掩蔽的扩散等方法。这些模型已被主要人工智能研究团队采用,包括OpenAI和Google DeepMind,用于从文本生成到蛋白质序列设计等任务。
数学基础
离散扩散模型定义了一个前向过程,该过程在时间步 \(t = 1, \dots, T\) 上逐渐将离散数据点 \(x_0\) 破坏为噪声状态 \(x_t\)。破坏通常建模为具有转移矩阵 \(Q_t\) 的马尔可夫链,其中每个条目 \([Q_t]_{ij}\) 表示从状态 \(i\) 转移到状态 \(j\) 的概率。常见选择包括均匀转移(每个标记变得同样可能)或吸收状态(标记被特殊掩蔽标记替换)。
逆向过程由神经网络参数化,通常是Transformer或U-Net,该网络学习根据噪声样本预测原始数据分布。训练最小化负对数似然的变分下界,类似于连续扩散,但使用离散分类损失。一个关键优势是前向过程可以闭式计算,从而无需模拟每一步即可高效训练。
主要变体
已提出多种离散扩散架构。多项式扩散由伯克利人工智能研究的研究人员于2021年提出,使用分类分布和均匀转移矩阵。基于掩蔽的扩散,如MaskGIT模型,采用吸收状态过程,其中标记在生成过程中逐步去掩蔽。最近的工作,如D3PM(离散去噪扩散概率模型)框架,通过允许学习转移矩阵来推广这些方法,该矩阵可以捕获特定领域结构,如图中的邻接性或文本中的语义相似性。
对于语言建模,离散扩散模型已集成到大规模系统中。例如,Google DeepMind的CDCD(连续时间离散扩散)模型和OpenAI后来关于扩散语言模型的工作,已在语言建模困惑度和文本生成质量等基准上展示了与自回归Transformer相当的性能。这些模型通常使用位置编码和多头注意力作为核心组件。
应用
离散扩散模型用于各种生成任务。在自然语言处理中,它们支持非自回归文本生成,由于所有标记并行生成,因此可能比顺序解码更快。这对于机器翻译和文本摘要等延迟至关重要的任务特别有用。在计算机视觉中,离散扩散已应用于生成具有离散像素值或量化潜在代码的图像,通常达到与连续模型相当的质量,同时更具可解释性。
除了文本和图像之外,离散扩散模型还用于生物信息学中生成蛋白质序列,以及药物发现中设计分子图。它们也出现在强化学习中(尽管未明确列出,但该概念相关),用于规划和策略生成。行业采用包括在Amazon Web Services和Microsoft Azure AI服务中的使用,这些服务为云平台中的生成功能提供支持。
与自回归模型的比较
传统的自回归模型,如GPT风格Transformer,以固定顺序逐标记生成数据,这简单但顺序化。相比之下,离散扩散模型可以同时生成所有标记,在AWS Trainium或Groq加速器等并行硬件上提供潜在加速。然而,它们通常需要更复杂的训练目标,并且可能在某些任务上产生略低质量的样本。最近的研究缩小了这一差距,扩散语言模型在GLUE和SuperGLUE等基准上达到接近持平的水平。
另一个区别在于可控性。扩散模型允许在逆向过程中灵活条件化,从而无需重新训练即可实现填充或引导生成。这使得它们对交互式应用(如代码补全或对话式AI)具有吸引力。
挑战与未来方向
尽管前景广阔,离散扩散模型仍面临挑战。由于需要许多逆向步骤,训练可能计算密集,尽管最近的方法如渐进式蒸馏降低了这一成本。采样质量可能随长序列而下降,处理可变长度输出仍是一个未解决问题。研究人员还在探索将离散扩散与RLHF相结合的混合方法,以使输出与人类偏好对齐。
未来方向包括将离散扩散模型扩展到万亿参数规模,将其与检索机制集成,以及开发更高效的转移矩阵。截至2025年,离散扩散仍是一个活跃的研究领域,贡献来自斯坦福人工智能实验室和MIT CSAIL等学术实验室,以及Anthropic和Meta等行业团队(尽管未列出,但该公司相关)。该方法预计将在生成式AI的更广泛格局中补充而非取代自回归模型。