视觉常识推理(VCR)是一个人工智能领域的研究基准和任务,用于评估系统理解图像并运用常识知识回答相关问题的能力。VCR于2019年提出,要求模型不仅要识别场景中的物体和动作,还要推断动机、心理状态以及合理的未来事件。它旨在测试超越基础视觉识别的高层次认知,弥合计算机视觉与自然语言处理之间的鸿沟。
VCR数据集包含超过29万个多项选择题,源自11万个电影场景,每个问题配有一个问题、四个答案选项和四个理由选项。模型必须选出正确答案,然后通过选择正确的理由来证明其选择。这种两阶段结构迫使系统产生解释,使得该基准比传统的视觉问答(VQA)更具挑战性。任务分为两个子任务:查询-答案(QA)和答案-理由(AR),整体性能通过VCR分数衡量,该分数是两个子任务准确率的乘积。
数据集与标注
VCR数据集由北卡罗来纳大学教堂山分校和艾伦人工智能研究所的研究人员创建。标注工作通过Amazon Mechanical Turk众包完成,工作人员被要求编写需要常识推理的问题,例如“这个人为什么在跑步?”或“接下来会发生什么?”每个问题都基于电影中的特定图像,提供了丰富的上下文线索,如社交互动、情绪表达和物理因果关系。数据集包含11万个独特的电影片段,每个片段平均有2.6个问题,形成了多样化的场景集合,这些场景并不仅仅偏向于物体识别。
任务形式化
形式上,VCR被定义为多项选择任务。给定图像I、问题Q和四个答案候选集合A = {a1, a2, a3, a4},模型必须预测正确答案a。然后,在给定相同图像、问题和正确答案的情况下,模型必须从四个理由候选中选择正确的理由R。最终VCR分数计算为同时选择正确答案和正确理由的准确率,即联合概率P(a | I, Q) P(r | I, Q, a*)。这种形式化鼓励模型产生连贯的解释,而不仅仅是猜测答案。
模型方法
早期的VCR系统依赖于视觉问答架构,该架构将用于图像特征提取的卷积神经网络(CNN)与用于文本的循环神经网络(RNN)或基于Transformer的编码器相结合。一个常见的基线是视觉常识推理Transformer(VCRT)模型,它使用多头注意力机制来融合视觉和文本表示。后来,基于大语言模型的方法,如微调BERT或GPT变体,被调整以处理多模态输入。这些模型通常采用两阶段流水线:首先,它们联合编码图像和问题,然后使用分类头来选择答案和理由。更近期的研究探索了使用交叉注意力层进行端到端训练,使模型能够在推理问题的同时关注相关的图像区域。
挑战与局限
尽管取得了进展,VCR仍然是一个困难的基准。模型常常在需要深层社会推理的问题上表现不佳,例如推断角色的意图或情绪状态。数据集也存在偏差,因为某些问题可以通过文本中的统计规律来回答,而非视觉证据。例如,模型可能学会将某些动词与典型物体关联起来,而并未真正理解场景。此外,理由选择任务尤其具有挑战性,因为它要求模型生成一个合理的解释,而不仅仅是答案的改写。截至2025年,VCR上表现最好的模型在QA子任务上达到约80%的准确率,在AR子任务上达到75%,但联合VCR分数仍低于60%,表明还有显著的改进空间。
影响与相关工作
VCR影响了后续的基准,如野外视觉常识推理(VCR-W),并被用作评估AI系统常识推理能力的测试平台。它还推动了可解释人工智能的研究,因为理由选择组件迫使模型提供可解释的论证。该数据集公开可用,并已被研究社区广泛采用,截至2025年引用次数超过1000次。VCR常与其他视觉推理任务(如视觉蕴含和视觉问答)进行比较,但其对解释的强调使其与众不同。该基准由艾伦人工智能研究所维护,并定期用于学术竞赛和研讨会。
未来方向
VCR的未来工作可能涉及整合更复杂的神经网络架构,例如在大规模图像-文本对上预训练的视觉-语言模型。此外,人们也有兴趣使用VCR来评估生成式人工智能系统的推理能力,其中模型必须生成自由形式的理由,而不是从固定集合中选择。研究人员还在探索通过引入对抗性示例或反事实问题来减少数据集偏差的方法。随着人工智能的持续发展,VCR作为衡量迈向人类水平视觉常识推理进展的关键基准,发挥着重要作用。