深度信念网络(DBN)是一种生成式图模型,或者说是深度神经网络的一类,由多层潜在变量(“隐藏单元”)组成,层间存在连接,但层内单元之间没有连接。在无监督地基于一组示例进行训练时,DBN能够学习以概率方式重建其输入,各层充当特征检测器。完成此学习步骤后,DBN可进一步通过监督训练来执行分类任务。
DBN可视为简单无监督网络(如受限玻尔兹曼机(RBM)或自编码器)的复合体,其中每个子网络的隐藏层作为下一子网络的可见层。RBM是一种无向的、生成式的基于能量的模型,具有可见输入层和隐藏层,层间有连接而层内无连接。这种复合结构促成了快速、逐层无监督的训练过程,其中对比散度依次应用于每个子网络,从最底层的两层开始(最底层的可见层即训练集)。
DBN可以逐层贪婪训练这一观察结果,催生了首批有效的深度学习算法之一。总体而言,DBN在现实生活和应用场景中有许多吸引人的实现和用途,例如脑电图分析和药物发现。
历史背景
深度信念网络出现于2000年代中期,是训练深度架构的一项突破。在其引入之前,训练多层神经网络因梯度消失和收敛缓慢等问题而异常困难。DBN引入的贪婪逐层预训练策略提供了一种实用的深度网络初始化方法,随后可针对监督任务进行微调。这项工作主要与杰弗里·辛顿及其在多伦多大学的同事相关,重新激发了人们对Deep learning的兴趣,并为后来Neural network架构的进步奠定了基础。
DBN的发展常被视为Artificial intelligence历史上的一个关键里程碑,它连接了早期关于概率模型和Machine learning的工作与现代深度学习。DBN在手写数字识别和文档分类等任务中的成功展示了分层特征学习的强大能力,影响了后续模型,如深度自编码器和卷积网络。
使用对比散度训练
杰弗里·辛顿为训练“专家乘积”模型而提出的RBM训练方法称为对比散度(CD)。CD提供了对理想情况下应用于学习权重的最大似然方法的近似。在训练单个RBM时,权重更新通过梯度下降执行,公式如下:
w_ij(t+1) = w_ij(t) + η * ∂log(p(v))/∂w_ij
其中p(v)是可见向量的概率,由p(v) = (1/Z) * Σ_h e^(-E(v,h))给出,Z为归一化配分函数,E(v,h)为网络状态的能量函数。较低的能量表示更“理想”的配置。梯度∂log(p(v))/∂w_ij具有简单形式⟨v_i h_j⟩_data - ⟨v_i h_j⟩_model,其中⟨...⟩_p表示相对于分布p的平均值。
挑战在于对⟨v_i h_j⟩_model进行采样,因为这需要扩展的交替吉布斯采样。CD通过运行n步交替吉布斯采样来替代此步骤(n=1的值表现良好)。n步后,对数据进行采样,并使用该样本代替⟨v_i h_j⟩_model。CD过程如下:
- 将可见单元初始化为训练向量。
- 根据可见单元并行更新隐藏单元:p(h_j=1|V) = σ(b_j + Σ_i v_i w_ij),其中σ为sigmoid函数,b_j为隐藏单元j的偏置。
- 从隐藏单元重建可见单元,然后基于重建再次更新隐藏单元。
- 使用原始相关性与重建相关性之间的差异执行权重更新。
此过程被贪婪地逐层应用于训练DBN。预训练后,整个网络可使用反向传播或其他监督方法进行微调。
应用与影响
深度信念网络已应用于多个领域。在医疗保健中,DBN被用于分析脑电图(EEG)信号,辅助检测神经系统疾病。在药物发现中,它们被用于预测分子性质并识别潜在药物候选者,利用其从化学数据中学习分层表示的能力。
DBN还在语音识别中用作声学模型,在图像识别任务中从原始像素中学习特征。它们在这些领域的成功展示了生成式预训练的通用性,影响了后来Generative AI和大型模型的发展。
尽管被Transformer (architecture)模型等更新架构所掩盖,DBN仍然是理解深度学习原理的重要教育工具。它们常在Machine learning和Deep learning课程中被研究,作为无监督预训练和分层特征学习的基础示例。
局限性与演变
DBN存在若干局限性。训练可能计算密集,尤其是对于大型数据集,且对比散度近似可能导致有偏估计。此外,作为生成模型,它们在特定任务上不如判别模型可扩展。Transformer (architecture)基础模型的兴起,尤其是在自然语言处理领域,将焦点从DBN转移,因为这些新架构通过端到端训练提供了更好的性能。
尽管如此,DBN背后的原理,,如逐层预训练和基于能量的建模,,继续影响现代研究。自编码器和变分自编码器等概念建立在类似思想上,贪婪预训练策略已在当代深度学习流程中以各种形式被改编。
遗产与进一步阅读
深度信念网络代表了Artificial intelligence演变中的一个关键转折点。它们证明了深度架构可以有效训练,为深度学习革命铺平了道路。MIT CSAIL、斯坦福人工智能实验室和伯克利人工智能研究等机构的研究人员在这些基础上进行了构建,推动了该领域的快速进步。
对于有兴趣进一步探索DBN的读者,辛顿及其合作者的原始论文提供了详细的推导和实验结果。关于Deep learning的教科书通常包含DBN和RBM的章节,提供理论和实践视角。随着领域持续发展,从DBN中获得的经验教训仍然具有相关性,尤其是在无监督学习和生成建模领域。