逐层相关性传播(LRP)是一种用于解释机器学习和深度学习中神经网络预测结果的技术。它通过将模型的输出预测从后向前逐层传播回网络,为每个输入特征计算相关性分数。这些分数表示每个特征对最终决策的贡献程度,通常以输入上的热图形式可视化。LRP基于守恒原理,即每一层的总相关性在重新分配到前一层时保持不变,确保相关性分数之和等于模型输出(减去偏置项)。这使得LRP成为一种有原则且数学严谨的模型可解释性方法,区别于通过改变输入观察输出变化的扰动方法。
LRP由Sebastian Bach、Alexander Binder、Grégoire Montavon、Klaus-Robert Müller和Wojciech Samek等研究人员于2010年代中期开发,源于可解释人工智能(XAI)的广泛领域。基础论文《On Pixel-Wise Explanations for Non-Linear Classifier Decisions by Layer-Wise Relevance Propagation》于2015年发表。此后,LRP已成为解释复杂模型的标准工具,尤其在计算机视觉和自然语言处理领域。它常用于验证模型是否关注相关特征、识别偏见以及调试意外行为。LRP已应用于从医学影像到自动驾驶等多个领域,并已扩展以处理各种网络架构,包括基于Transformer的模型。
核心原理
LRP的核心思想是通过局部重分配规则将预测输出f(x)从后向前传播回网络。对于每一层中的每个神经元i,其相关性R_i根据后续层中神经元j的相关性以及它们之间的加权连接来计算。最基本的规则称为LRP-0规则,它根据每个神经元对下一层激活的贡献比例来分配相关性。形式上,对于激活值为a_j的神经元j和连接神经元i到j的权重w_{ij},从j到i的相关性由R_{i \leftarrow j} = (a_i w_{ij} / \sum_{i'} a_{i'} w_{i'j}) R_j给出。该规则确保每一层中的相关性之和等于下一层中的相关性之和,满足守恒性质。
然而,当分母接近零时,LRP-0规则可能不稳定。为解决此问题,提出了几种变体。LRP-epsilon规则在分母中添加一个小的正常数epsilon以稳定计算。LRP-gamma规则通过更重地加权正贡献来放大它们,这可以改善某些模型的解释质量。LRP-alpha-beta规则允许正负贡献的加权组合,由参数alpha和beta控制,并满足约束alpha + beta = 1。这些变体提供了灵活性,可根据特定应用和模型类型定制解释。
与反向传播的关系
LRP与反向传播在概念上相似,反向传播是通过梯度裁剪和SGD变体训练神经网络的算法。两者都涉及通过网络的反向传递。然而,它们的目的根本不同。反向传播计算损失函数相对于网络权重的梯度,以在训练期间更新它们。相比之下,LRP计算输入特征相对于特定预测的相关性分数,而不修改网络。虽然梯度也可用于归因(例如,显著性图),但它们存在梯度饱和和噪声等问题。LRP通过明确强制执行守恒并使用定制的重分配规则,旨在产生更连贯且人类可解释的解释。
在计算机视觉中的应用
在计算机视觉中,LRP经常应用于卷积神经网络(CNN),以生成热图,突出显示图像中哪些像素对分类决策影响最大。例如,在医学影像中,LRP已用于解释从X射线或MRI扫描中检测疾病的模型的预测,帮助放射科医生信任和验证模型的关注点。在自动驾驶中,LRP可以突出显示模型用于决策的道路场景区域,例如检测行人或交通标志。该技术还用于识别虚假相关性,例如模型依赖水印或背景对象而不是实际感兴趣的对象。
在自然语言处理中的应用
随着大型语言模型和Transformer架构的兴起,LRP已被适应以解释文本分类和生成任务。在NLP中,相关性通过注意力层和前馈网络传播,以分配输入句子中单个标记或单词的重要性分数。这有助于理解模型为何做出特定预测,例如情感分类或主题标记。例如,LRP可以揭示情感模型严重依赖“不”或“优秀”等词,而忽略中性词。LRP的扩展已开发用于处理Transformer的特定结构,包括通过多头注意力机制和残差连接的传播。
变体和扩展
除了基本规则外,还提出了几种LRP扩展以处理不同场景。深度泰勒分解(DTD)提供了一个理论框架,将LRP与泰勒展开统一起来,为复杂非线性推导重分配规则提供了有原则的方法。LRP还与其他可解释性方法结合,例如模型剪枝和数据增强,以提高模型鲁棒性和可解释性。对于时间序列数据,LRP可应用于循环神经网络(RNN)和长短期记忆(LSTM)网络,但需要调整传播规则以处理循环连接。此外,LRP已与注意力机制结合使用,以提供更细粒度的解释。
与其他可解释性方法的比较
LRP是解释神经网络预测的几种技术之一。其他流行方法包括SHAP(SHapley Additive exPlanations)、LIME(Local Interpretable Model-agnostic Explanations)和积分梯度。SHAP基于合作博弈论,提供统一的特征归因框架,但计算成本可能很高。LIME使用可解释的代理模型局部近似模型,但解释可能不稳定。积分梯度与LRP一样是基于反向传播的方法,但依赖于沿从基线到输入的路径积分梯度。LRP通常因其计算效率以及无需多次模型评估即可产生清晰、局部化解释的能力而受到青睐。然而,方法的选择取决于具体用例、模型架构以及解释的期望属性。
局限性和挑战
尽管LRP具有优势,但它也有局限性。解释的质量取决于重分配规则及其超参数的选择,这可能需要对每个模型进行调整。对于非常深的网络或具有复杂非线性的模型,LRP可能产生噪声或反直觉的解释。守恒性质虽然在理论上具有吸引力,但由于数值问题或近似,在实践中可能并不总是精确成立。此外,LRP主要设计用于可微分模型;将其应用于不可微分模型或具有离散组件的模型需要额外调整。关于LRP解释的忠实度也存在持续争论,因为不同规则可能对同一预测产生不同归因。
软件和实现
几个开源库实现了LRP,使其易于实践者使用。由蒂宾根大学团队开发的innvestigate库为各种归因方法(包括LRP)提供统一接口,并支持TensorFlow和Keras等流行深度学习框架。zennit库提供更灵活和可组合的实现,允许用户定义自定义传播规则。对于PyTorch用户,torchxrayvision和其他专门包包含LRP实现。这些工具促进了LRP在研究和工业中的采用,使实践者能够以最少的编码工作生成解释。
未来方向
关于LRP的研究持续发展,努力改进其理论基础、扩展到新架构并集成到模型开发流程中。随着生成式AI和大型语言模型变得更加普遍,对其输出解释的兴趣日益增长,LRP正在被适应以处理这些模型的规模和复杂性。此外,将LRP与因果推断和反事实推理相结合是一个活跃的探索领域。目标是超越简单的特征归因,转向更全面和可操作的解释,以支持模型调试、偏见检测和法规合规。