结构反向传播

译自英文

通过结构的反向传播是一种机器学习技术,它将反向传播扩展到计算通过结构化数据(如图或树)的梯度,从而实现对非向量输入的学习。它用于涉及关系或层次数据的深度学习任务中。

通过结构反向传播是一种机器学习技术,将反向传播算法推广到通过结构化数据表示(如图、树或具有内部依赖关系的序列)计算梯度。与处理固定大小向量的标准反向传播不同,该方法通过模型的结构连接传播误差信号,从而能够在处理关系或层次信息的架构中学习参数。它是深度学习的基础,适用于自然语言解析、分子性质预测和知识图谱推理等应用。

该方法开发于1990年代,建立在1980年代引入的更广泛的反向传播算法之上。它与循环神经网络(RNN)和图神经网络(GNN)密切相关,其中输入数据的结构直接影响计算图。通过将结构视为可微分模型的一部分,通过结构反向传播能够对必须推理实体间关系的系统进行端到端训练。

历史背景

这一概念源于早期针对结构化数据的神经网络研究。1990年,Paolo Frasconi和Marco Gori提出了通过结构反向传播的思想,作为循环网络的时间反向传播(BPTT)的扩展。他们的关键见解是,相同的梯度计算原理可以应用于任意有向无环图(DAG),而不仅仅是时间序列。这使得模型能够处理诸如解析树或分子图之类的输入,其中元素的顺序不是固定的。

后来,在2000年代和2010年代,深度学习的兴起重新激发了对该技术的兴趣。多伦多大学卡内基梅隆大学等机构的研究人员将该方法适配到现代架构中,促成了图神经网络的发展。该技术还影响了Sequence-to-Sequence (Seq2Seq)模型的研究,其中输入和输出序列之间的结构对齐是学习得到的。

核心机制

在标准反向传播中,损失函数相对于每个权重的梯度是通过链式法则在网络各层中计算的。通过结构反向传播遵循相同的原理,但操作于反映输入结构的计算图上。对于给定的结构化输入(如树),前向传播通过按拓扑顺序遍历结构来计算激活值。反向传播则反向传播误差梯度,将每个子节点的贡献累积到其父节点。

这要求模型定义一个可微分的聚合函数,例如求和、均值或基于注意力的加权组合,作用于每个节点的子节点。梯度计算必须考虑同一权重可能在结构中的多个节点间共享,这一性质称为权重绑定。这种共享减少了参数数量并提高了泛化能力,但使梯度计算复杂化,因为共享权重的梯度是其所有使用位置的梯度之和。

在现代AI中的应用

通过结构反向传播是许多最先进系统的核心组件。在自然语言处理中,它使基于Transformer (architecture)的模型(如大型语言模型)能够处理句法解析树,尽管大多数现代transformer使用序列注意力。更直接地,它用于图神经网络中的任务,如分子性质预测,其中分子结构(原子和键)表示为图。Google DeepMindOpenAI等公司已将这些技术整合到药物发现和材料科学的模型中。

在计算机视觉中,该技术支持场景图生成,其中对象及其关系被建模为图。它还出现在强化学习中,用于在结构化状态空间(如机器人技术)中进行规划。例如,WaymoTesla Autopilot使用驾驶场景的结构化表示,尽管它们的主要训练依赖于卷积和transformer网络。该方法还与课程学习相关,其中利用训练数据的结构来提高学习效率。

挑战与局限性

一个主要挑战是计算成本。处理大型图或深层树需要与节点数成比例的内存,这对于大型结构可能难以承受。梯度裁剪等技术通常必不可少,以防止梯度爆炸,尤其是在结构较深时。此外,训练期间假设固定结构可能具有局限性;许多现实任务涉及随时间变化的动态结构,需要自适应计算。

另一个局限性是处理噪声或不完整结构的难度。如果输入结构不准确,梯度信号可能会产生误导。研究人员通过注意力机制和软对齐来解决这些问题,但这些方法往往模糊了结构处理与序列处理之间的界限。该领域持续发展,最近关于残差网络层归一化的工作提高了结构化模型的训练稳定性。

与其他技术的关系

通过结构反向传播与时间反向传播(BPTT)密切相关,后者是序列情况下的特例。它还与现代深度学习库中使用的自动微分框架共享原理。该技术不同于基于强化学习的方法,后者使用奖励信号而非可微分损失函数,尽管存在混合方法。

生成式AI的背景下,该方法支撑了生成结构化输出(如分子图或程序语法树)的模型。它也是图神经网络的前身,后者已成为AI工具包中的标准工具。与多头注意力的关系是间接但值得注意的:注意力机制可以被视为一种软性的、可学习的结构聚合形式,在许多应用中已基本取代了硬编码结构。

未来方向

研究正在探索如何将通过结构反向传播扩展到更大、更复杂的结构,例如社交网络或生物系统中发现的结构。人们也对将其与大型语言模型结合以实现知识图谱推理感兴趣。截至2020年代初,大多数商业AI系统,包括AnthropicAmazon Web Services的系统,主要依赖transformer架构,但结构方法仍是学术研究的热点领域。随着领域向更可解释和关系型AI发展,该技术可能会重新受到关注。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·neural-networks·structured-data
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史