概念瓶颈模型(CBM)是一种神经网络架构,旨在通过强制模型首先输出一组人类可理解的概念,然后利用这些概念做出最终决策,从而使预测更具可解释性。这种两阶段设计与标准的端到端深度学习模型形成对比,后者的内部表示通常是不透明的。通过将中间层约束为对应有意义的属性,CBM允许用户看到哪些概念影响了预测,甚至可以通过修正概念值来干预并改变结果。
概念瓶颈模型于2020年由麻省理工学院计算机科学与人工智能实验室和斯坦福人工智能实验室的研究人员提出,作为对医疗诊断和自动驾驶等高风险应用中日益增长的透明度需求的回应。其核心思想建立在早期可解释机器学习工作的基础上,特别是计算机视觉中语义属性的使用,但将其形式化到现代深度学习框架中。自提出以来,CBM已得到扩展和细化,出现了解决准确性权衡和放宽概念标签要求的变体。
架构与机制
标准概念瓶颈模型由两个主要组件组成:概念编码器和任务预测器。概念编码器接收输入(例如图像或文本),并输出一个概念分数向量,其中每个分数对应预定义概念的预测存在性或强度。这些概念由人类专家选择,旨在具有语义意义,例如图像分类器中的“有羽毛”或“有轮子”。
任务预测器随后将这些概念分数作为输入,并产生最终输出,例如类别标签或回归值。整个模型是联合训练的,损失函数同时应用于概念预测和最终任务预测。在推理过程中,模型可以以三种模式使用:独立模式(使用预测概念)、顺序模式(使用预测概念,但任务预测器基于真实概念训练)和交互模式(允许用户在最终预测前修正概念值)。
概念层充当瓶颈,因为它限制了输入与最终输出之间的信息流。这种限制是有意为之:它迫使模型以人类可解释的属性进行推理,而不是依赖不可解释的特征。概念的选择至关重要,因为它们必须既对任务具有预测性,又对目标用户可理解。
训练与损失函数
训练概念瓶颈模型通常涉及多任务损失。总损失是概念预测损失(对于二元概念通常为二元交叉熵,对于连续概念为均方误差)和任务预测损失(例如分类的交叉熵)的加权和。权重可以调整,以平衡概念准确性与任务准确性之间的侧重。
在原始公式中,概念编码器和任务预测器从零开始联合训练。然而,后续工作探索了两阶段训练,即先训练概念编码器以预测概念,然后在冻结的概念编码器之上训练任务预测器。这种方法可能更稳定,并允许使用预训练的概念编码器。另一种变体称为“干预感知”训练,在训练过程中纳入模拟用户干预,使模型在测试时对概念修正更具鲁棒性。
一个关键挑战是概念标签通常获取成本高昂。为解决这一问题,一些方法使用弱监督或无监督方法发现概念,但这可能牺牲人类可解释性的保证。其他方法,如“事后”概念瓶颈模型,先训练标准黑盒模型,然后拟合概念层以解释其决策,但这不保证概念被因果使用。
准确性权衡
概念瓶颈模型的主要批评之一是,它们可能不如标准端到端模型表现良好,尤其是当概念集不完整或概念不能完美预测任务时。瓶颈限制了最终预测器可用的信息,如果概念未捕获所有相关特征,准确性会下降。实证研究表明,在CUB-200-2011(鸟类)和AwA2(动物)等基准数据集上,CBM通常比无约束模型实现更低的准确性。
然而,权衡并不总是严重的。在某些任务中,特别是概念与决策边界良好对齐时,CBM可以实现与黑盒模型接近的性能。研究人员还提出了缓解准确性差距的方法,例如允许任务预测器从输入接收残差连接(绕过瓶颈)或使用更大的概念词汇表。概念的选择和概念监督的质量是影响准确性-可解释性权衡的最重要因素。
变体与扩展
自原始CBM以来,已开发出几个值得注意的变体。“带附加输入的概念瓶颈模型”(CBM-AI)在输入与任务预测器之间添加残差连接,允许模型在必要时使用不可解释特征,但代价是部分可解释性。“干预感知概念瓶颈模型”(IA-CBM)通过模拟干预进行训练,使其对用户修正更具响应性。
另一研究方向侧重于自动概念发现。例如,“概念嵌入模型”学习概念嵌入而非二元分数,“无标签概念瓶颈模型”使用预训练的大语言模型从文本描述生成概念候选,减少手动概念标注的需求。这些方法已应用于医学影像和自然语言处理等领域,其中概念标签稀缺。
在生成式AI的背景下,CBM已被用于通过干预概念值来控制图像生成模型的输出。例如,CBM可用于通过设置相应的概念分数来生成具有特定属性(如“红腹”或“长尾”)的鸟类图像。这展示了该架构在分类之外的更广泛实用性。
应用
概念瓶颈模型已在多个高风险领域找到应用。在医疗保健中,它们被用于诊断皮肤病变和从电子健康记录预测患者结果,临床医生重视看到哪些症状或特征驱动了决策的能力。在自动驾驶中,CBM可以基于“停车标志”或“行人过街”等概念预测交通标志或行人行为,从而实现更安全的人类监督。
在金融领域,CBM已应用于信用评分和欺诈检测,其中监管要求通常要求对自动化决策进行解释。在自然语言处理中,它们被用于情感分析和毒性检测,以“积极情感”或“包含仇恨言论”等概念作为中间输出。CBM提供的可解释性也便于调试,因为开发人员可以识别哪些概念导致错误并进行修正。
局限性与批评
尽管具有优势,概念瓶颈模型仍面临若干局限性。最显著的是对预定义概念的依赖,这需要领域专业知识,并且可能无法覆盖任务的所有相关方面。如果缺少某个概念,模型无法使用它,可能导致系统性错误。此外,概念独立的假设在实践中经常被违反,建模概念之间的相关性是一个持续的研究领域。
另一个批评是,CBM提供的可解释性仅与概念定义的质量一样好。如果概念模糊或非互斥,解释可能具有误导性。此外,用户可能并不总是具备有效干预的专业知识,交互模式需要人机协作,这在所有部署场景中可能不可行。最后,准确性权衡仍然是一个实际障碍,一些研究人员认为,黑盒模型上的事后解释方法可以在没有性能损失的情况下提供类似的见解。
未来方向
概念瓶颈模型的研究持续发展,有多个有前景的方向。一个领域是与Transformer架构的集成,该架构在视觉和语言领域已成为主导。最近的工作探索了如何将概念瓶颈纳入基于Transformer的模型,例如在中间层添加概念预测头。另一个方向是利用人类反馈来细化概念定义,并改善模型与用户期望的一致性。
人们还对使用CBM进行模型剪枝和效率提升越来越感兴趣,因为瓶颈结构可用于降低计算成本。此外,概念瓶颈框架正在扩展到多模态输入,其中概念可以跨越不同模态,例如结合视觉和文本属性。随着对可解释AI的需求增长,特别是在受监管行业中,概念瓶颈模型可能仍是一个活跃的研究和开发领域。