反向传播论文

译自英文

1986年,鲁梅尔哈特、欣顿和威廉姆斯发表了一篇里程碑式的论文,推广了反向传播算法,这是一种通过链式法则高效计算梯度以训练神经网络的方法。这项工作推动了现代机器学习和深度学习的兴起。

1986年,大卫·鲁梅尔哈特、杰弗里·辛顿和罗纳德·威廉姆斯发表了一篇开创性论文,推广了反向传播,这是一种高效计算神经网络中梯度的算法。反向传播应用微积分中的链式法则,计算损失函数相对于网络权重的梯度,将导数从输出层反向传播到输入层。这种方法避免了冗余计算,使得训练多层网络变得可行。尽管该术语严格指梯度计算,但它常被宽泛地用来描述整个学习过程,包括通过随机梯度下降等方法或Adam等优化器进行的参数更新。1986年的论文整合了早期思想,并展示了该算法的有效性,推动了其在机器学习中的广泛采用,为现代深度学习人工智能应用奠定了基础。

历史背景

反向传播在1986年之前有着曲折的历史,多次被独立发现。20世纪60年代和70年代的早期工作包括多位研究者的贡献,如塞波·林纳迈马在1970年引入了反向模式自动微分,以及保罗·韦博斯在1974年的博士论文中描述了该算法。然而,这些努力相对默默无闻。1986年,鲁梅尔哈特、辛顿和威廉姆斯在《自然》期刊上发表了《通过反向传播误差学习表征》,该论文清晰地呈现了算法,并展示了其在学习异或函数等问题上的强大能力。这一出版物,连同《并行分布式处理》一书(同样出版于1986年),将反向传播推至神经网络研究的前沿。该论文的影响力因其可读性和对联结主义模型日益增长的兴趣而被放大,引发了20世纪80年代末的研究热潮。

技术基础

反向传播计算前馈网络中每个权重相对于损失函数的梯度。对于输入-输出对\((x_i, y_i)\),网络通过多层加权和与激活函数产生预测\(g(x_i)\)。损失\(C(y_i, g(x_i))\)衡量预测与目标之间的误差。该算法通过应用链式法则,从输出层向后工作,计算损失相对于每个权重的偏导数。这需要评估激活函数和损失函数的导数,这些函数必须是可微的。常见选择包括隐藏层的Sigmoid或ReLU激活,以及交叉熵或平方误差损失。梯度指示调整权重以减少损失的方向,通常使用梯度下降。1986年的论文强调,反向传播可以学习隐藏层中的内部表征,使网络能够解决以前难以处理的问题。

影响与遗产

1986年的论文是神经网络领域的催化剂,但由于当时硬件训练速度慢以及训练深层网络的困难等限制,兴趣在20世纪90年代有所消退。然而,该算法仍然是基础性的。在2010年代,计算能力、大型数据集以及批归一化残差网络等技术的进步复兴了深度学习,反向传播成为核心训练机制。如今,反向传播支撑着几乎所有现代AI系统,包括大型语言模型,如OpenAIAnthropicGoogle DeepMind开发的模型,以及Transformer生成式AI工具。该算法的效率和通用性使其成为该领域的标准,每门机器学习课程都在教授,每个主要框架都在实现。

相关发展

反向传播的成功催生了众多扩展和变体。研究人员开发了改进的优化算法,如AdamSGD变体,以及Dropout等正则化技术和权重初始化策略。反向传播所体现的反向模式自动微分概念,现在在神经网络之外的科学计算中被广泛使用。多伦多大学(辛顿曾在此工作)和斯坦福AI实验室等机构成为深度学习研究的中心。1986年的论文常被视为转折点,其作者获得了众多荣誉,包括辛顿与约书亚·本吉奥和扬·勒昆因对深度学习的贡献共同获得2018年图灵奖。尽管年代久远,反向传播仍然是主导的训练方法,尽管正在进行的研究探索了课程学习和受生物学启发的方法等替代方案。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·neural-networks·deep-learning·history-of-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史