2006年,由杰弗里·辛顿领导的多伦多大学研究团队引入了深度信念网络,这是一类深度生成模型,可以通过贪婪的逐层方法高效训练。这一突破标志着机器学习的一个转折点,证明了多层神经网络能够从数据中学习有用的特征表示,而无需大量手工设计的工程。虽然“深度学习”一词此前已被使用,但2006年的工作提供了训练深度架构的首个实用方法,引发了人们对神经网络的重新关注,并最终推动了现代人工智能的繁荣。
深度信念网络由多层潜在变量组成,其中每一层捕获输入数据越来越抽象的表征。训练过程包括无监督预训练阶段,其中每一层作为受限玻尔兹曼机进行训练,随后对整个网络进行微调。这种方法克服了早期深度网络困扰的梯度消失问题,使得从原始数据中学习特征层次成为可能。深度信念网络的成功为深度学习的后续发展奠定了基础,包括卷积神经网络、循环神经网络,以及最终的变换器。
理论基础
2006年的突破基于通用逼近定理,该定理指出,具有单个隐藏层的前馈神经网络可以逼近任何连续函数,这一结论由乔治·西本科于1989年证明,并由库尔特·霍尼克于1991年推广。然而,已知具有多层的深度网络在表示某些函数时更为高效,而贪婪的逐层训练方法提供了一种训练此类网络的实用途径。神经网络的概率解释,即将激活函数视为累积分布函数,也在深度信念网络的发展中发挥了作用,因为它们是学习输入数据联合分布的生成模型。
对机器学习的影响
深度信念网络的引入表明,与浅层模型相比,深度学习在分类和表示学习等任务上可以实现更优越的性能。这导致机器学习社区从手工特征工程转向端到端学习。无监督训练深度网络的能力尤为重要,因为未标记数据比标记数据更丰富。这项工作还影响了其他深度架构的发展,包括深度玻尔兹曼机和堆叠自编码器,并为计算机视觉、语音识别和自然语言处理中的深度学习革命铺平了道路。
遗产与演变
在2006年突破之后,深度学习迅速发展,关键里程碑包括2015年残差网络的开发,它允许训练非常深的网络,以及2017年变换器架构的引入,该架构成为现代大型语言模型的基础。贪婪逐层训练和无监督预训练的原则影响了后来的技术,如批量归一化和丢弃法,这些技术进一步稳定并加速了深度网络的训练。如今,深度学习是人工智能的基石,应用范围从医学图像分析到自动驾驶,其影响持续增长。
更广泛的背景
深度学习是更广泛的机器学习领域的一部分,而机器学习本身是人工智能的一个子领域。2006年的突破并非孤立事件,而是建立在数十年神经网络研究的基础上,包括沃伦·麦卡洛克和沃尔特·皮茨1943年的早期工作、弗兰克·罗森布拉特1958年的感知机,以及1980年代推广的反向传播算法。“深度学习”一词由里纳·德克特于1986年引入机器学习社区,并由伊戈尔·艾森伯格及其同事于2000年引入人工神经网络。然而,辛顿及其团队在2006年的工作被广泛认为证明了深度架构的实用可行性,并为随后的快速进展奠定了基础。