机制可解释性是人工智能安全和机器学习领域中的一个研究项目,旨在将神经网络训练后的权重逆向工程为人类可理解的算法描述,而非像大多数可解释人工智能方法那样仅从外部近似其行为。该方法对待训练模型的方式类似于逆向工程师在没有源代码的情况下处理编译后的二进制代码:通过探测单个神经元、层以及权重的组合,研究人员试图恢复网络在执行任务时使用的离散特征和电路,最终目标是能够以阅读源代码时同样的信心预测、验证或编辑模型的行为。
起源
计算机视觉中的早期可解释性工作,包括与在线期刊Distill相关的特征可视化研究,表明图像分类器(如卷积神经网络模型)中的单个神经元或小群神经元可能对应可识别的概念,如曲线、纹理或物体部件。克里斯·奥拉,Anthropic的联合创始人及该领域的领军人物,帮助推广了这种视觉化、基于电路的分析风格,随后将其扩展到语言模型。Transformer架构和大型语言模型系统的兴起将领域焦点转向理解注意力头、残差流以及使模型能够执行诸如上下文学习等任务的内部表示。
关键发现
可解释性研究人员已识别出若干反复出现的现象。叠加(Superposition)描述了神经网络通常表示的特征数量多于其神经元数量这一发现,将多个概念打包到激活空间中的重叠方向里,这使得单个神经元难以孤立解释。稀疏自编码器,作为更广泛自编码器技术的一种应用,已被用于将这些重叠表示分解为更大规模的、更单语义且可单独解释的特征集;Anthropic在2024年的工作在生产规模的Claude模型中识别出数百万个此类特征,以及后续定位和编辑特定行为相关特征的研究,是该领域讨论最广泛的结果之一。其他研究方向已识别出负责狭窄能力的特定电路,例如让Transformer模型完成重复模式的“归纳头”机制,并利用可解释性工具检测模型内部的欺骗或目标泛化错误迹象,而非仅依赖其表面输出。
动机与利害关系
支持者认为,机制可解释性是少数几个能让人类真正洞察高能力模型是否在追求其表面目标的研究方向之一,而非仅依赖行为测试,这一关切与关于对齐和奖励黑客的辩论密切相关。由于可解释性旨在直接打开黑箱而非事后解释,一些研究人员认为它是自信部署更强大未来系统(包括任何接近通用人工智能的系统)的前提条件。
局限性
该领域仍远未对任何前沿模型提供完整描述;当前技术难以扩展到生产模型的规模,稀疏自编码器特征并未干净地覆盖网络的所有行为,且没有公认的方法来验证基于可解释性的解释是完整的而非仅仅是合理的。研究人员普遍将机制可解释性描述为一门早期阶段的科学,其雄心可与神经科学绘制生物大脑图谱的努力相媲美,尽管在成熟度上尚不及。