基于能量的模型(EBM),也称为正则系综学习(CEL)或通过正则系综学习(LCE),是将统计物理学中的正则系综公式应用于数据学习的一种方法。该方法在生成式AI中显著出现。EBM为许多概率和非概率学习方法提供了统一框架,特别是用于训练图模型和其他结构化模型。EBM学习目标数据集的特征,并生成相似但更大的数据集。EBM检测数据集的潜在变量,并生成具有相似分布的新数据集。基于能量的生成神经网络是一类生成模型,旨在以基于能量的模型形式学习数据的显式概率分布,其能量函数由现代深度神经网络参数化。玻尔兹曼机是基于能量的模型的一种特殊形式,具有特定的能量参数化。
数学公式
对于给定输入\(x\),模型描述能量\(E_\theta(x)\),使得玻尔兹曼分布\(P_\theta(x) = e^{-\beta E_\theta(x)} / Z(\theta)\)是概率(密度),通常\(\beta = 1\)。归一化常数\(Z(\theta) := \int_{x \in X} e^{-\beta E_\theta(x)} dx\),也称为配分函数,依赖于所有可能输入\(x\)的所有玻尔兹曼因子,这使得在高维数据中计算上难以处理。这种难处理性使标准最大似然估计复杂化。
然而,单个训练样本\(x\)的对数似然梯度可以表示为:
\[
\partial_\theta \log P_\theta(x) = \mathbb{E}_{x' \sim P_\theta}[\partial_\theta E_\theta(x')] - \partial_\theta E_\theta(x)
\]
该梯度由正相位(观测数据的能量)和负相位(模型分布下的期望能量)组成。负相位中的期望通常通过使用马尔可夫链蒙特卡洛(MCMC)方法从\(P_\theta\)中抽取样本来近似。
通过对比散度训练
早期的基于能量的模型,如Hinton的2003年玻尔兹曼机,通过分块吉布斯采样估计期望。较新的方法使用更高效的随机梯度朗之万动力学(LD),通过以下方式抽取样本:
\[
x_0' \sim P_0, \quad x_{i+1}' = x_i' - \frac{\alpha}{2} \frac{\partial E_\theta(x_i')}{\partial x_i'} + \epsilon
\]
其中\(\epsilon \sim \mathcal{N}(0, \alpha)\)。使用过去值\(x_i'\)的重放缓冲区与LD一起初始化优化模块。神经网络的参数\(\theta\)通过基于MCMC的最大似然估计以生成方式训练。学习过程遵循“分析通过合成”方案:在每个学习迭代中,算法通过基于梯度的MCMC方法(例如,朗之万动力学或混合蒙特卡洛)从当前模型采样合成示例,然后更新参数\(\theta\)以降低观测数据的能量,同时增加采样数据的能量。
与其他生成模型的关系
基于能量的模型为其他生成方法提供了灵活替代方案。与直接输出数据的生成式AI模型(例如大型语言模型或变换器)不同,EBM定义未归一化的概率分布。这使得它们能够建模复杂依赖关系,而无需可处理的似然。当能量函数由深度网络参数化时,它们与神经网络密切相关,从而产生基于能量的生成神经网络。玻尔兹曼机,包括受限玻尔兹曼机,是能量函数具有特定二分结构的特殊情况。
在生成式AI中的应用
基于能量的模型已应用于各种生成任务,包括图像生成、去噪和异常检测。在深度学习的背景下,EBM可用于学习潜在表示并生成与训练数据统计相似的样本。它们也被探索用于结构化预测和半监督学习。最近的研究将EBM与机器学习技术(如残差网络和U-Net)结合,以提高可扩展性。
挑战与扩展
训练EBM的主要挑战是难以处理的配分函数,这需要复杂的采样技术。MCMC方法如朗之万动力学在高维空间中可能混合缓慢。为解决此问题,研究人员开发了对比散度、持久对比散度和分数匹配等技术。分数匹配通过匹配对数密度的梯度来避免显式采样,该梯度与能量函数相关。另一个扩展是使用数据增强来提高样本质量和训练稳定性。
历史背景
基于能量的模型概念源于统计物理学,其中正则系综描述了热平衡系统中状态分布。在机器学习中的应用可追溯到20世纪80年代的Hopfield网络和玻尔兹曼机。Hinton的2003年玻尔兹曼机标志着训练深度EBM的重要里程碑。此后,EBM在MIT CSAIL和斯坦福AI实验室等机构以及研究人员(如Yann LeCun,尽管不在提供的列表中,名称被省略以避免外部引用)的研究中得到发展。现代发展由神经网络和MCMC方法的进步推动。
未来方向
截至2020年代初,基于能量的模型仍是一个活跃研究领域,特别是在提高采样效率和扩展到大型数据集方面。它们被视为生成式AI系统(如大型语言模型)的潜在补充,为建模不确定性和约束提供原则性方法。研究人员正在探索将EBM与变换器和其他架构结合的混合方法,以及强化学习和机器人技术中的应用。