译自英文

深度学习是机器学习的一个子领域,通过训练多层神经网络,直接从原始数据中学习层次化表示,为现代计算机视觉、语音和语言系统提供动力。

深度学习是机器学习的一个分支,它使用具有多层堆叠的人工神经网络,直接从原始数据(如像素、音频波形或文本)中学习分层表示,而无需手工设计的特征。“深度”一词指的是输入与输出之间的层数。

历史

深度学习的数学基础可追溯至20世纪80年代,当时反向传播被推广为训练多层网络的方法。由于数据有限、计算能力有限以及其他统计方法的竞争,进展在90年代和21世纪初陷入停滞,这一时期有时被描述为联结主义方法特有的更广泛AI寒冬的一部分。该领域的现代时代通常以2012年为起点,当时在图形处理单元上训练的深度卷积神经网络AlexNet,以远超基于手工特征方法的优势赢得了ImageNet竞赛。研究人员杰弗里·辛顿扬·勒昆约书亚·本吉奥,后来被称为该领域的创始三人组,因奠定其基础而获得2018年图灵奖;辛顿与物理学家约翰·霍普菲尔德因相关基础工作共同获得2024年诺贝尔物理学奖。

架构

早期深度学习的成功来自用于图像的卷积网络和用于文本、语音等序列数据的循环神经网络(包括LSTM变体)。2017年推出的变换器架构,利用注意力机制并行处理序列,而非逐步递归,在很大程度上取代了语言任务中的循环网络,并成为现代大型语言模型的基础。网络通过最小化损失函数来训练,使用梯度下降的变体,并通过反向传播计算每个参数应如何调整。

为何在大规模下有效

与早期统计方法相比,深度网络从更多数据和更多计算中获益不成比例,这一关系后来被形式化为缩放定律。这种缩放行为,加上最初为图形渲染而构建的GPU硬件的并行处理能力,使得从业者能够在2010年代和2020年代训练越来越大的模型。英伟达在AI能力GPU及其CUDA软件平台上的主导地位,因此成为行业基础设施的核心部分。

影响与批评

深度学习推动了计算机视觉、语音识别、机器翻译以及最受公众关注的文本和图像生成方面的快速进步。批评者指出,深度网络在很大程度上仍然不透明,作为统计模式匹配器,其失败难以预测,并且需要巨大的能源和数据资源,引发了环境和版权方面的担忧。支持者反驳说,同样的缩放方法已反复产生了并非明确设计的能力,这一模式是当前关于该领域向更通用智能发展轨迹辩论的核心。

分类:deep-learning·fundamentals
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史