概念瓶颈模型(CBM)是一类神经网络架构,旨在通过在输入与最终预测之间插入一层人类可理解的概念瓶颈层来提升可解释性。CBM 并非直接将原始数据映射到输出,而是首先预测一组预定义的概念(例如“有翅膀”“是红色的”),然后利用这些概念预测来做出最终决策。这种设计使用户能够检查哪些概念影响了预测,并通过修正概念值进行干预,从而使模型比标准黑箱模型更加透明、更易于调试。
该框架在 2020 年由 Pang Wei Koh、Thao Nguyen、Yew Siang Tang、Stephen Mussmann、Brandon Ying 和 Percy Liang 发表的论文中正式提出,并在第 34 届神经信息处理系统大会(NeurIPS 2020)上展示。作者证明,CBM 在图像分类任务上能够达到与黑箱模型相当的准确率,同时提供可解释性优势。他们还引入了若干变体,例如“可干预”CBM,用户可覆盖预测出的概念以观察最终预测的变化;以及“联合”CBM,同时训练概念预测器和最终预测器。
架构与设计
标准 CBM 由三个组件构成:特征提取器(通常是预训练的ResNet或类似的深度学习骨干网络)、将特征映射到概念概率的概念预测器,以及将概念概率映射到输出标签的最终预测器。概念层通常是一个线性层或小型多层感知机,而最终预测器通常采用线性模型以保持可解释性。
Koh 等人探索了三种训练范式:独立训练(先训练概念预测器并冻结,再训练最终预测器)、顺序训练(先训练概念预测器,再用概念标签训练最终预测器)以及联合训练(同时训练两者并采用加权损失)。他们在 CUB-200-2011 鸟类数据集(含 312 个概念)和 SUN 属性数据集(含 102 个属性)上的实验表明,独立训练的 CBM 准确率低于标准模型,但联合训练显著缩小了这一差距。例如,在 CUB 上,标准 ResNet-18 的准确率约为 75%,联合 CBM 约为 72%,而独立 CBM 约为 66%。
可解释性与干预
CBM 的一个关键特性是具备干预能力:如果模型对某个概念的预测有误(例如,当鸟实际为蓝色时预测“翅膀颜色:棕色”),用户可以修正该概念并重新运行最终预测器。Koh 等人证明,即使仅对单个错误预测的概念进行干预,也能显著提升准确率。在 CUB 数据集上,对每张图像仅干预一个概念,独立模型的准确率从 66% 提升至超过 90%,联合模型也获得了类似的提升。这使得 CBM 在需要人工监督的高风险领域中具有重要价值。
干预机制还支持调试:通过检查哪些概念频繁被错误预测,开发者可以识别特征提取器或概念定义中的薄弱环节。然而,干预效果取决于概念集是否全面且标注准确,这是实际应用中的一大主要限制。
扩展与变体
自 2020 年以来,研究者提出了多种扩展方案。Rieger 等人于 2021 年提出的“标签特定概念瓶颈模型”允许概念在类别间共享,从而减少标注负担。Yukara Ikami 等人于 2021 年提出的“后验概念瓶颈模型”以及 Wong 等人后续的工作,引入了将预训练黑箱模型转换为 CBM 的方法,无需从头重新训练,而是通过概念发现步骤实现。另一条研究路线是 Zarlenga 等人于 2021 年提出的“概念嵌入模型”,通过使用连续概念嵌入来放宽二元概念假设,从而提升表达能力。
2023 年,Collins 等人提出的“交互式概念瓶颈模型”增加了用户在推理过程中查询模型以获取概念解释的机制;Kim 等人于 2023 年提出的“概念擦除概念瓶颈模型”则解决了概念泄漏问题,即最终预测器可能依赖概念之外的信息。这些扩展已在 CUB、SUN 以及合成数据集 dSprites 上进行了评估,在准确率与可解释性之间呈现出不同的权衡。
应用领域
CBM 已应用于医学影像领域,其中可解释性至关重要。例如,Graziani 等人于 2022 年开展的一项研究将 CBM 用于皮肤病变分类,基于 ABCD 规则定义了“不对称性”“边界不规则”等概念,在 ISIC 2018 数据集上取得了 0.91 的 AUC,与黑箱基线(0.93)相当,同时具备解释预测的能力。在放射学中,CBM 也被用于胸部 X 光诊断,涉及“心脏肥大”“胸腔积液”等概念,Chen 等人于 2021 年在 CheXpert 数据集上的研究显示,干预可将准确率从 0.82 提升至 0.87。
在自动驾驶领域,CBM 被探索用于预测驾驶员行为或理解交通场景。Zhang 等人于 2023 年发表的一项研究将 CBM 用于行人检测,涉及“正在过马路”“正在张望”等概念,在自定义数据集上达到了 95% 的准确率,同时允许人工修正错误分类的概念。在金融领域,CBM 被提出用于信用评分,涉及“收入稳定性”“负债比率”等概念,但由于监管和数据方面的挑战,其采用率仍然有限。
局限性与挑战
CBM 的主要局限性在于需要概念标注,而这类标注成本高昂。对于大规模数据集,定义一套完整且互不重叠的概念集十分困难。此外,CBM 在复杂任务上的表现往往不如黑箱模型,因为概念瓶颈限制了信息流动。例如,在 ImageNet 上,使用 1000 个概念(每个类别一个)的 CBM 仅达到 55% 的 Top-1 准确率,而标准 ResNet-50 为 76%,这一结果来自 Koh 等人 2021 年的后续研究。
另一个问题是概念泄漏:最终预测器可能无意中利用概念概率中不具有语义意义的关联,从而削弱可解释性。研究者提出了正则化技术,例如对概念嵌入施加正交性约束,以缓解这一问题。此外,CBM 假设概念之间相互独立,但现实中的概念往往彼此相关(例如“有羽毛”和“会飞”),这可能导致预测冗余或相互矛盾。
与其他可解释性方法的关系
CBM 属于更广泛的可解释模型家族,包括决策树、基于规则的系统和基于注意力的解释方法。与显著性图或LIME等事后解释方法不同,,这些方法在模型训练完成后才进行解释,,CBM 在设计上就具备内在可解释性。CBM 与注意力机制(常见于Transformer)也有联系,后者同样提供一定程度的可解释性,但注意力权重往往噪声较大,难以直接用于决策。CBM 还与模型剪枝相关,两者都旨在简化模型,但剪枝减少的是模型规模,而 CBM 降低的是模型的不透明性。
近期研究将 CBM 与大语言模型(LLM)相结合。例如,Oikarinen 等人于 2023 年发表的一篇论文使用 GPT-3 自动生成数据集的概念候选,从而减少人工标注需求。Yang 等人于 2024 年开展的一项研究则利用 LLM 迭代优化概念定义,在 CUB 上将 CBM 的准确率相较于固定概念集提升了 3%。这些混合方法正成为活跃的研究方向,尤其是随着生成式 AI模型能力的不断增强。
未来方向
未来研究重点在于将 CBM 扩展到更大规模的数据集和更复杂的任务,例如视频理解与多模态输入。同时,也有研究致力于从数据中自动学习概念,采用无监督或自监督方法,尽管这些概念可能无法完全对齐人类语义。另一个方向是将 CBM 与强化学习相结合,用于序列决策任务,在机器人和游戏等领域,可解释性有望发挥重要作用。
截至 2025 年,CBM 仍是一种小众但具有影响力的方法,已被超过 2000 篇论文引用。在医疗和金融等监管要求强制可解释性的领域,CBM 尤其受到重视。然而,其大规模部署仍受限于标注成本和准确率差距,能否实现可扩展且性能足够优越的 CBM,仍有待进一步验证。