卷积深度信念网络(CDBN)是一种深度学习模型,它将卷积神经网络的层次化特征提取与深度信念网络的概率生成学习相结合。它旨在从图像、音频频谱图和视频帧等二维数据中无监督地学习高层特征。该模型于2000年代末提出,作为受限玻尔兹曼机的扩展,以高效处理大规模、空间结构化的输入。
CDBN由多层卷积受限玻尔兹曼机(convRBM)组成,其中每一层学习越来越抽象的特征。与全连接的深度信念网络不同,CDBN使用局部感受野和共享权重,大幅减少了参数数量,并使其能够扩展到高分辨率输入。该模型使用对比散度逐层训练,之后可选地使用监督信号进行微调。
架构
CDBN的核心构建模块是卷积受限玻尔兹曼机。在convRBM中,可见层表示输入图像,隐藏层由特征图组成。每个特征图通过一组共享的滤波器权重(也称为卷积核)连接到可见层。池化层(通常为最大池化)降低了隐藏激活的空间维度,提供了平移不变性和计算效率。
CDBN堆叠多个convRBM,其中一层的池化输出作为下一层的可见输入。这种层次结构使网络能够在早期层学习低级边缘和纹理,在后期层学习更高级的物体或部件。模型的概率性质使其能够从学习到的分布中生成新样本,这是标准判别式卷积网络所不具备的特性。
训练
CDBN的训练以贪婪、逐层的方式进行。每个convRBM使用对比散度单独训练,这是一种近似最大似然估计的技术。学习规则根据数据相关统计量与模型相关统计量之间的差异更新共享滤波器权重和偏置。在所有层预训练完成后,整个网络可以使用带标签数据通过反向传播进行微调,以用于分类任务。
训练CDBN的一个挑战是概率图模型中推理的计算成本,尤其是对于大尺寸图像。为解决此问题,研究人员使用了均值场推理和块吉布斯采样等近似方法。此外,在随机梯度下降中使用小批量数据和动量有助于稳定训练。
应用
CDBN已应用于多种计算机视觉任务,包括物体识别、人脸检测和场景分类。它们也被用于音频处理和医学成像等领域的无监督特征学习。在2010年代初期,CDBN在CIFAR-10和NORB等基准数据集上取得了有竞争力的结果,证明了其在没有大量标注数据的情况下学习有用表示的有效性。
最近,CDBN的原理影响了其他生成模型,如变分自编码器和生成对抗网络,尽管由于端到端深度学习和大规模监督训练的兴起,CDBN本身如今已较少使用。
与其他模型的关系
CDBN与其他深度架构在概念上具有相似性。它们是标准卷积神经网络(纯判别式)的概率对应物。与基于Transformer (architecture)的模型(如大型语言模型)不同,CDBN专为空间数据设计,不依赖注意力机制。CDBN的生成能力也使其区别于典型的残差网络和U-Net,后者是前馈且任务特定的。
在机器学习的更广泛背景下,CDBN代表了将无监督预训练与卷积架构相结合的早期尝试,这一主题后来影响了多伦多大学和MIT CSAIL等机构的深度学习研究。
局限性与遗产
尽管具有理论吸引力,CDBN面临实际局限性。训练计算密集,概率推理可能较慢。与纯监督卷积网络相比,其性能提升通常有限,尤其是在大规模标注数据集和GPU加速训练可用之后。因此,CDBN在很大程度上已被更简单、更可扩展的模型所取代。
然而,CDBN背后的思想,,层次化特征学习、局部连接和生成建模,,仍然具有影响力。它们是现代深度学习历史基础的一部分,与神经网络和深度信念网络等其他早期模型并列。研究人员继续重新审视生成方法以用于半监督学习和表示学习,使CDBN的遗产保持相关性。