译自英文

玻尔兹曼机是一种随机递归神经网络,通过基于统计力学启发的能量动力学学习二进制状态上的概率分布。它是马尔可夫随机场,并且是带有外部场的舍林顿-柯克帕特里克模型的一个实例。

玻尔兹曼机是一种随机循环神经网络,它学习表示二进制输出状态上的概率分布并从中采样。其名称源于统计力学中的玻尔兹曼分布,该分布根据每个网络状态的能量决定其概率。该模型也被归类为马尔可夫随机场,并且是带有外场的舍灵顿-柯克帕特里克模型的一个特定实例,也称为随机伊辛模型。它在认知科学和Machine learning社区中由杰弗里·辛顿、特里·塞诺夫斯基和扬·勒昆大力推广,作为更广泛的基于能量的模型类别的一部分,其中自旋玻璃的哈密顿量充当定义学习任务的能量函数。

玻尔兹曼机在理论上因其训练算法的局部性和赫布性质而著称,该算法遵循赫布规则,并因其并行性和与简单物理过程的相似性而受到关注。然而,具有无约束连接的玻尔兹曼机在机器学习或推理的实际问题中并未证明有用。当连接受到适当约束时,例如在受限玻尔兹曼机中,学习变得足够高效以用于实际应用。

结构

玻尔兹曼机由二进制单元组成的网络构成,每个单元产生0或1的状态。整个网络具有一个全局能量函数,其形式与霍普菲尔德网络和伊辛模型相同,定义为:

E = -(对所有i<j的w_ij s_i s_j之和 + 对所有i的theta_i * s_i之和)

其中,w_ij是单元j和单元i之间的连接强度,s_i是单元i的二进制状态,theta_i是单元i的偏置,-theta_i表示激活阈值。权重通常表示为对称矩阵W,对角线为零。

单元状态概率

单个单元i从关闭到开启导致的全局能量差异,记为Delta E_i,由连接单元的权重之和加上偏置给出。该能量差异通过玻尔兹曼因子与两种状态的概率相关联,其中状态的概率与exp(-E / (k_B T))成正比,k_B为玻尔兹曼常数,T为人工温度参数。这种关系使网络能够随机更新单元,倾向于较低能量的配置。

训练算法

玻尔兹曼机的训练旨在调整权重和偏置,使网络的平衡分布与可见单元上的目标分布相匹配。学习规则是局部且赫布式的:权重的变化与网络被钳制到数据时和自由运行时的两个单元相关性之差成正比。这种对比学习过程依赖于从模型分布中采样,通常使用马尔可夫链蒙特卡洛方法。该算法的局部性使其在生物学上具有合理性,但无约束网络面临收敛缓慢和可扩展性差的问题。

实用变体

为解决全连接玻尔兹曼机的低效问题,研究人员引入了受限玻尔兹曼机(RBM),它将连接约束为两层,,可见层和隐藏层,,且层内无连接。这种约束使得使用对比散度进行更高效的训练成为可能。堆叠的RBM构成了深度信念网络的基础,这些网络在Deep learning的早期发展中具有影响力。这些变体已应用于降维、特征学习和协同过滤等任务,尽管在许多领域中它们已在很大程度上被其他架构所取代。

遗产与影响

玻尔兹曼机为Generative AI和基于能量的模型贡献了基础概念。其随机动力学和概率解释影响了神经网络研究的后续发展,包括潜变量的使用和基于采样的推理。虽然它在当代大规模系统(如大型语言模型)中未被广泛使用,但其理论见解在理解概率图模型和无监督学习方面仍然具有相关性。该模型的名称在文献中持续存在,作为随机循环网络的典型示例以及统计物理学与Artificial intelligence之间的桥梁。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:neural-networks·machine-learning·energy-based-models·statistical-mechanics
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史