激活修补是一种用于机制可解释性的因果干预技术,机制可解释性是可解释人工智能的一个子领域,旨在通过分析神经网络的具象结构、算法和电路来理解其内部运作。该方法涉及在正向传播过程中修改特定神经元、层或注意力头的激活,并观察模型输出的相应变化。通过系统性地干预内部状态,研究人员可以衡量单个组件对模型行为的因果贡献,从而以类似于传统软件调试的方式对网络进行逆向工程。
该技术是机制可解释性更广泛目标的核心,旨在识别机器学习模型权重中编码的结构、电路或算法。与早期主要侧重于“黑箱”解释(如显著性图或基于梯度的归因)的可解释性方法不同,激活修补提供了内部状态与输出之间的直接因果联系。这使其成为验证模型行为、检测人工智能错位等潜在风险以及理解大型语言模型(LLM)和其他神经网络如何从给定输入得出具体结论的有力工具。
起源与发展
“机制可解释性”一词由Anthropic联合创始人Chris Olah创造,用于描述他在电路分析方面的工作,这与可解释人工智能中的常规方法形成对比。电路分析试图完整刻画模型中的单个特征和电路,而更广泛的领域则倾向于基于梯度的方法,如显著性图。在电路分析之前,该子领域的工作将特征可视化、降维和归因等多种技术与人类计算机交互方法相结合,以分析像视觉模型Inception v1这样的模型。
激活修补作为电路分析的自然延伸应运而生,提供了一种检验关于哪些组件对特定行为至关重要的假设的方法。早期应用集中在视觉模型上,但随着基于transformer的大型语言模型的兴起,该技术获得了显著地位,并成为研究注意力头、残差流和前馈网络的标准工具。Anthropic、OpenAI和Google DeepMind等机构的研究人员此后对方法进行了改进,并将其与稀疏自编码器等其他可解释性工具相结合。
核心原理
激活修补基于这样的原理,即神经网络的内部表示以分布式方式编码信息。在正向传播的给定点上,神经元或层的激活是一个捕获特征混合的向量。通过将该激活替换为来自不同输入(或反事实设置)的值,研究人员可以观察输出的变化,从而隔离该组件的作用。
该技术依赖于线性表示假设,该假设认为高层概念被表示为神经网络激活空间中的线性方向。来自词嵌入和大型语言模型的实证证据支持了这一观点,尽管它并非普遍成立。激活修补利用这种线性性,通过针对可解释的概念方向进行定向干预。
方法
典型的激活修补实验涉及三次正向传播。首先,使用干净输入运行基线传播,以记录模型输出并存储感兴趣的激活。其次,使用修改后的输入(例如,用关键名词替换的句子)运行损坏传播,以产生不同输出并存储损坏的激活。第三,运行修补传播,在特定层或头处将损坏传播的激活替换为干净传播的激活,并将输出与基线进行比较。
修补传播与损坏传播之间的输出差异表示被修补组件的因果效应。如果修补特定头恢复了原始输出,则该头可能对任务至关重要。相反,如果修补没有效果,则该组件可能是冗余或无关的。这个过程可以对所有组件重复,以生成网络的因果图,通常可视化为热图或图形。
在大型语言模型中的应用
激活修补已成为大型语言模型机制可解释性的基石。研究人员使用它来识别哪些注意力头负责特定的语言现象,如主谓一致、指代消解或事实回忆。例如,在transformer模型中,在像“猫坐在垫子上”这样的句子中修补特定注意力头的激活,可以揭示该头是否编码了“猫”和“坐”之间的关系。
该技术还用于研究残差流,即transformer中的主要信息高速公路。通过在不同层修补残差流,研究人员可以追踪信息如何从输入流向输出以及在哪里发生变换。这导致了对归纳头(负责从上下文中复制模式)和其他功能电路的发现。
与稀疏自编码器的关系
激活修补通常与稀疏自编码器(SAE)结合使用,SAE是经过训练以将神经网络激活分解为稀疏表示的模型。SAE的学习维度通常代表简单、人类可理解的概念。通过将SAE应用于语言模型的激活,研究人员可以识别在给定上下文中哪些特征处于活动状态,然后修补这些特征以测试其因果作用。Anthropic已将这种技术应用于大型语言模型的可解释性,使用SAE将激活分解为可解释特征,然后修补这些特征以验证其效果。
这种组合允许比修补原始激活更细粒度的干预,因为它针对特定的概念方向而不是整个层。它还有助于解决叠加的挑战,即许多特征被压缩到少量神经元中。
电路与因果分析
神经网络中的电路由特征激活的因果链组成。通过绘制哪些电路导致哪些下游后果,以及通过激活和抑制电路,人们可以分析神经网络(如LLM)如何从给定输入达到给定结果。激活修补是这种映射的主要工具,因为它允许研究人员测试假设的电路是否确实对某种行为是必要的。
例如,在视觉模型中,一个电路可能由一组检测边缘的神经元、一组检测角的神经元以及一组最终识别物体的神经元组成。用随机值修补边缘检测神经元的激活会破坏整个电路,而修补更后层可能具有更局部的影响。这种层次分析有助于构建模型内部算法的完整图景。
局限性与挑战
激活修补有几个局限性。首先,它在计算上昂贵,需要对每个测试组件进行多次正向传播。对于具有数十亿参数的大型模型,这可能是不可行的。其次,损坏输入的选择至关重要;选择不当的损坏可能导致误导性结果。第三,该技术假设组件独立运作,但实际上组件之间的交互可能混淆分析。
此外,激活修补仅提供模型的局部、输入特定视图。对一个输入至关重要的组件可能对另一个输入无关紧要,因此从单一实验中得出的结论可能无法推广。研究人员通常需要在多样输入上运行许多实验,以建立稳健的理解。
未来方向
截至2020年代中期,激活修补是一个活跃的研究领域,工作重点在于将该技术扩展到更大模型并自动化电路发现。像TransformerLens库这样的工具使研究人员更容易将修补应用于开源模型,学术实验室与Anthropic和Google DeepMind等行业团体的合作正在加速进展。最终目标是发展对神经网络内部的全面理解,这可能为人工智能安全实践提供信息,并带来更可靠、更可控的人工智能系统。
另见
- 机制可解释性
- 稀疏自编码器
- circuit-analysis
- 人工智能对齐
- 大型语言模型
- Transformer