概念激活向量

译自英文

概念激活向量(CAVs)是机器学习中的一种技术,用于通过测试特定概念是否编码在模型内部激活中,来解释神经网络的表示。

概念激活向量(CAV)是一种用于解释机器学习神经网络内部表示的技术。该技术由谷歌大脑和斯坦福大学的研究人员于2017年提出,提供了一种测试给定概念(如“条纹”或“医生”)是否编码在模型激活中的方法。该方法涉及训练一个线性分类器,以区分包含该概念的示例与不包含该概念的示例的激活,然后将分类器的权重向量用作CAV。该向量指向激活空间中对应于该概念的方向,使研究人员能够以人类可解释的方式探测模型的理解。

CAV广泛应用于AI可解释性领域,特别是针对深度学习模型,用于评估偏差、验证学习到的特征以及提高透明度。它们对于大型语言模型变换器尤其重要,因为在这些模型中,理解模型“知道”什么对于信任和安全性至关重要。

背景与动机

随着神经网络复杂性的增加,其内部工作机制变得越来越不透明。早期的可解释性方法侧重于可视化单个神经元或注意力权重,但这些方法往往无法捕捉表示的分布式特性。2017年,谷歌大脑的Been Kim领导的团队试图通过提出一种更系统化的模型查询方式来解决这一问题。他们的工作发表于论文《超越特征归因的可解释性:使用概念激活向量进行定量测试(TCAV)》,将CAV作为更广泛框架TCAV(使用概念激活向量进行测试)的一部分引入。其动机是超越简单的特征归因,实现对模型在决策过程中是否使用某一概念的定量测试。

关键见解在于,概念通常表示为高维激活空间中的方向,而非单个神经元。通过在这些激活之上训练一个线性探针,可以提取一个捕捉概念方向的向量。这种方法基于一个观察,即神经网络通常为高层概念学习线性可分离的表示。

CAV的工作原理

计算CAV的过程涉及几个步骤。首先,选择一组代表感兴趣概念的示例(例如,条纹物体的图像)和一组不代表的“反例”(例如,非条纹物体的图像)。然后,在模型上运行这些示例,并记录选定层的激活。接下来,训练一个线性分类器(通常是支持向量机或逻辑回归)来区分两组激活。该分类器的权重向量(归一化为单位长度)即成为CAV。

获得CAV后,可用于测试模型对概念的敏感性。例如,在TCAV中,计算模型输出相对于沿CAV方向的激活的 directional derivatives。正导数表示当概念存在时模型的预测增加,表明模型依赖该概念。这可以在网络的任何层进行,从而提供概念使用的逐层分析。

在可解释性中的应用

CAV已应用于多个领域,包括计算机视觉和自然语言处理。在原始论文中,作者在图像分类模型上演示了该技术,表明模型使用“条纹”或“斑点”等概念来分类斑马和豹子。他们还使用CAV检测潜在偏差,例如模型在分类医生图像时使用“性别”作为因素。

自然语言处理中,CAV已被用于探测大型语言模型中的“毒性”、“情感”或“主题”等概念。例如,研究人员使用CAV来识别模型是否将某些人口统计术语与负面情感相关联,从而揭示隐藏的偏差。这对于部署在现实应用中的生成式AI系统尤为重要。

与其他可解释性方法的关系

CAV是更广泛的可解释性技术家族的一部分,包括特征归因、显著性图和激活最大化。与突出输入特征的显著性图不同,CAV作用于内部表示。它们也与线性探测相关,即训练分类器在激活上预测属性;CAV通过使用分类器的权重向量作为概念方向扩展了这一点。

与神经元级分析相比,CAV捕捉分布式表示,使其对多义性(即单个神经元响应多个不相关概念的现象)更具鲁棒性。这在现代变换器中是一个显著优势,因为多义性很常见。

局限性与挑战

尽管CAV具有实用性,但也存在局限性。一个主要挑战是反例的选择。CAV的质量在很大程度上取决于负例的选择;如果它们不具有代表性,CAV可能捕捉到虚假的相关性。此外,CAV是线性的,可能无法捕捉非线性概念关系。另一个问题是CAV是事后计算的,这意味着它们反映的是模型已经学到的内容,而非可能学到的内容。

此外,CAV需要访问模型的内部激活,这对于专有模型可能不可用。这导致了与黑盒模型配合使用的替代方法的发展,但CAV仍然是白盒可解释性的宝贵工具。

扩展与变体

已提出了CAV的多种扩展。例如,“概念瓶颈模型”将概念方向直接纳入模型架构,允许显式的基于概念的推理。另一种变体“自动概念发现”使用聚类自动发现概念,无需人工标记的示例。在大型语言模型的背景下,研究人员已调整CAV以处理token级激活,从而能够细粒度分析概念在不同上下文中的表示方式。

近期工作还探索了使用CAV进行模型编辑和去偏。通过识别概念方向,可以潜在地调整模型的表示,以减少对不需要的概念(如性别或种族)的依赖。这是AI安全性和公平性研究中的一个活跃领域。

影响与未来方向

CAV对AI可解释性领域产生了重大影响,影响了后续关于机制可解释性和表示工程的工作。它们现在是可解释性工具包中的标准工具,被OpenAIAnthropic谷歌深度思维等机构的研究人员使用。随着模型规模的持续增长,对CAV等可解释性方法的需求变得更加迫切。未来方向包括为多模态模型开发CAV、提高概念提取的鲁棒性,以及将CAV集成到自动化审计系统中。

总之,概念激活向量提供了一种原则性的方式来测试概念是否编码在模型的表示中,从而深入了解模型学习的内容及其决策方式。其简单性和有效性使其成为现代可解释性研究的基石。

参见

参考文献

  • Kim, B., et al. (2018). Interpretability Beyond Feature Attribution: Quantitative Testing with Concept Activation Vectors (TCAV). ICML.
  • Koh, P. W., et al. (2020). Concept Bottleneck Models. ICML.
  • Goh, G., et al. (2021). Multimodal Neurons in Artificial Neural Networks. Distill.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:interpretability·machine-learning·neural-networks
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史