机制可解释性(有时缩写为mech interp、mechinterp或MI)是可解释人工智能领域内的一个研究分支,旨在通过分析神经网络的具象结构、算法和电路来理解其内部运作方式。这种方法试图以类似于逆向工程传统软件的方式分析神经网络,超越黑箱解释,识别驱动模型行为的具体机制。自2020年代初以来,该领域迅速发展,Anthropic、OpenAI和Google DeepMind等研究组织以及MIT CSAIL、Stanford AI Lab和BAIR (Berkeley AI Research)等学术机构做出了重要贡献。
机制可解释性位于更广泛的可解释人工智能背景下,但通过聚焦于因果、结构性分析而非事后归因方法而与之区分。它借鉴了机器学习、深度学习和神经网络理论的概念,并且对于审计大型语言模型和其他生成式人工智能系统变得尤为重要。其最终目标是提供与传统软件工程相当的理解水平,使代码可以被检查、调试和验证。
历史
“机制可解释性”一词由Anthropic联合创始人Chris Olah创造,用以描述他在电路分析方面的工作,区别于可解释AI中的常规方法。电路分析试图完全刻画模型中的个别特征和电路,而更广泛的领域则倾向于基于梯度的方法,如显著性图。Olah的早期工作,在他在OpenAI及后来在Anthropic期间进行,为理解神经网络奠定了更严谨、自下而上的基础。
在电路分析之前,该子领域的工作结合了特征可视化、降维和归因等多种技术,以及人机交互方法,来分析像视觉模型Inception v1这样的模型。这些早期努力,也涉及Google DeepMind和学术实验室的研究人员,表明神经网络通常在其中间层编码可解释的特征,但缺乏验证因果关系的系统方法论。
该领域在2010年代末和2020年代初随着Transformer模型占据主导地位而获得动力。Jacob Steinhardt、Llion Jones以及Anthropic和OpenAI的其他研究人员开始发表小模型的详细电路分析,并随后将这些技术扩展到更大的系统。到2023年,机制可解释性已成为一个公认的子领域,拥有专门的研讨会、会议和资助计划。
关键概念
机制可解释性旨在识别机器学习模型权重中编码的结构、电路或算法。这与早期主要关注“黑箱”解释(如显著性图或特征归因)的可解释性方法形成对比。核心假设是,尽管神经网络复杂,但它们实现了离散的、可分析的计算,可以被逆向工程。
一个核心概念是“特征”,指的是激活空间中对应于人类可理解概念(如特定对象、语义类别或句法角色)的方向或模式。特征通常通过稀疏自编码器或降维等技术来识别。另一个关键概念是“电路”,即连接输入和输出的特征激活的因果链。通过映射电路,研究人员可以追踪模型如何处理信息并做出决策。
线性表示假说
该假说认为,高层概念在神经网络的激活空间中表示为线性方向。来自词嵌入和大型语言模型的实证证据支持这一观点,尽管它并非普遍成立。例如,在许多基于Transformer的模型中,性别、时态或情感等概念可以通过添加或减去特定向量来操纵,表明存在线性结构。然而,一些概念似乎以非线性方式分布,该假说仍是一个活跃的研究领域。
线性表示假说对可解释性具有实际意义,因为它表明可以使用简单的线性代数技术(如主成分分析或稀疏字典学习)来识别特征。它也支撑了许多稀疏自编码器方法,这些方法旨在从原始激活中恢复这些线性方向。
方法
机制可解释性采用因果方法来理解内部模型组件如何影响输出,通常使用因果理论中的形式化工具。这些方法包括激活修补,即将一个输入的激活替换到另一个输入中观察输出变化;消融研究,即移除或置零特定组件;以及基于梯度的归因,尽管该领域通常偏好因果干预而非相关性方法。
典型的分析流程包括几个步骤:首先,训练或选择一个模型,通常是小型Transformer或用于视觉任务的残差网络。接下来,研究人员使用特征可视化或稀疏自编码器等技术识别候选特征。然后,他们进行因果实验以验证这些特征在特定行为中的作用。最后,他们构建总结特征与层之间交互的电路图。
在AI安全领域,机制可解释性用于理解和验证复杂AI系统的行为,并试图识别潜在风险,如AI对齐失败。通过提供模型内部的细粒度视图,它旨在使检测欺骗性或意外行为成为可能,这些行为可能在输出中显现之前就被发现。
稀疏自编码器
稀疏自编码器(SAE)是一种训练用于将神经网络激活分解为稀疏表示的模型。学习到的维度通常代表简单、人类可理解的概念。该技术由Anthropic在2023年和2024年应用于大型语言模型可解释性,并在从Claude等模型中提取可解释特征方面取得了显著成功。SAE通过从一组小的活动特征中重建激活来工作,鼓励网络学习稀疏的过完备基。
SAE已被用于识别特定实体、情感甚至抽象推理模式等概念的特征。它们对于分析大型语言模型特别有用,因为其激活空间是高维且密集的。然而,SAE的训练可能计算成本高昂,且所得特征可能并不总是与人类类别完美对齐。
特征与电路
神经网络中的电路由特征激活的因果链组成。通过映射哪些电路导致哪些下游后果,以及通过激活和抑制电路,可以分析神经网络(如LLM)如何从给定输入得出给定结果。例如,研究人员已识别出用于间接宾语识别(模型正确预测动作接受者)和小型Transformer中算术运算等任务的电路。
电路分析通常涉及激活修补和logit透镜等技术,使研究人员能够检查中间表示。在视觉模型中,已发现用于检测边缘、纹理和对象部件的电路,而在语言模型中,已映射出用于句法一致、事实回忆甚至某些推理形式的电路。目标是构建一个可跨模型重用和验证的全面电路库。
应用与影响
机制可解释性有几个实际应用。在AI安全中,它用于审计模型中的隐藏偏见、后门或错位目标。例如,研究人员使用电路分析来检测模型何时可能依赖虚假相关性或表现出谄媚行为。在模型调试中,可解释性可以帮助工程师识别模型在特定输入上失败的原因,并指导微调或重新训练。
该领域还为更可解释架构的设计提供信息。一些研究人员提出构建具有内置可解释性的模型,例如使用稀疏自编码器作为层或纳入解耦表示。然而,这些方法仍处于实验阶段,关于可解释性是否能在不牺牲性能的情况下实现存在争论。
截至2025年,机制可解释性仍是一个快速发展的领域,面临开放挑战。将分析扩展到GPT-4或Claude 3等大型模型计算强度大,且电路复杂性随模型规模增长。此外,关于理论基础存在持续讨论,一些研究人员质疑鉴于随机训练过程,神经网络是否能被完全逆向工程。
参见
参考文献
- Olah, C., et al. (2020). "Zoom In: An Introduction to Circuits." Distill.
- Elhage, N., et al. (2021). "A Mathematical Framework for Transformer Circuits." Anthropic.
- Cunningham, H., et al. (2023). "Sparse Autoencoders Find Highly Interpretable Features in Language Models." Anthropic.
- Nanda, N., et al. (2023). "Emergent Linear Representations in World Models of Self-Supervised Sequence Models." BlackNLP Workshop.
延伸阅读
- Bricken, T., et al. (2023). "Towards Monosemanticity: Decomposing Language Models With Dictionary Learning." Anthropic.
- Lieberum, T., et al. (2023). "Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla." DeepMind.
- Rauker, T., et al. (2023). "Towards Interpretable Deep Learning: A Review." arXiv.