KVQA(知识感知视觉问答)是人工智能和机器学习的一个子领域,它结合了计算机视觉、自然语言处理和知识表示。与仅依赖图像视觉内容的传统视觉问答(VQA)不同,KVQA系统还必须访问并推理外部知识源,例如知识图谱、百科全书数据库或结构化事实,才能生成准确答案。此任务要求模型不仅识别图像中的对象、场景和关系,还要检索相关的世界知识,并执行多步推理,以回答可能涉及图像中不可直接见到的实体、属性或事实的问题。
KVQA的发展与深度学习的进步以及大规模多模态模型的出现密切相关。2010年代中期引入的早期VQA数据集侧重于仅凭图像即可回答的问题。然而,研究人员很快认识到,许多自然问题,例如“谁建造了这座建筑?”或“这个城市的人口是多少?”,需要外部知识。这一认识促成了KVQA专用基准的创建,以及将知识库集成到神经架构中,通常使用基于Transformer的模型,这些模型可以同时关注视觉特征和文本知识表示。
历史发展
KVQA的概念源于更广泛的VQA研究议程,该议程在2015年弗吉尼亚理工大学和微软的研究人员发布VQA数据集后获得了关注。最初的VQA任务纯粹是视觉性的,但后续工作,例如2016年引入的FVQA(基于事实的视觉问答)数据集,明确要求外部事实。FVQA提供了一个三元组(主语、关系、宾语)的知识库,并让模型检索相关事实来回答问题。随后出现了其他数据集,如KVQA(同名数据集,2018年由印度理工学院德里分校及其合作者引入),该数据集侧重于关于名人和地点的问题,需要来自维基百科和Freebase等来源的知识。
这些早期数据集使用结构化知识库,并通常依赖序列到序列模型或注意力机制来结合图像特征与检索到的知识。2017年Transformer架构的引入,特别是多头注意力机制,使得视觉和文本信息的更复杂融合成为可能。到2010年代末,LXMERT和VisualBERT等模型(在图像-文本对上预训练)开始整合知识模块,尽管它们仍然难以处理训练数据中不存在的开放域知识。
核心挑战
与标准VQA相比,KVQA提出了若干独特挑战。首先,系统必须确定何时需要外部知识;许多问题可以仅凭图像回答,而不必要的知识检索可能引入噪声。其次,检索过程必须高效且准确,通常要求系统实时查询大型知识库。第三,视觉和基于知识的证据的整合需要复杂的推理,因为答案可能依赖于组合多个事实或解决所见与所知之间的矛盾。
另一个重大挑战是数据增强和标注成本。创建KVQA数据集需要将图像与答案不在图像中的问题配对,这要求人工标注和知识库整理。这导致使用半自动流水线从知识图谱生成问题,但这些流水线通常产生简单或不自然的问题。因此,许多KVQA模型在有限领域(如著名地标或名人)上进行评估,其在开放域问题上的表现仍然有限。
现代方法
随着大型语言模型和多模态模型(如来自OpenAI的GPT-4V和来自谷歌DeepMind的Gemini)的兴起,KVQA经历了范式转变。这些模型通常基于具有数十亿参数的Transformer架构,在大量文本和图像语料库上进行预训练,隐式编码了大量世界知识。因此,它们通常可以在没有显式检索的情况下回答基于知识的视觉问题,利用参数中嵌入的知识。这种方法有时被称为“闭卷”KVQA,在OK-VQA(外部知识VQA)等基准上显示出令人印象深刻的结果,该基准于2019年引入,需要外部知识。
然而,闭卷模型存在局限性,包括幻觉(生成看似合理但错误的答案)以及难以处理罕见或近期事实。为解决此问题,混合方法将参数化知识与非参数化检索相结合,使用交叉注意力等技术将检索到的知识片段与视觉特征融合。例如,REVEAL和KAT(知识增强Transformer)等模型使用检索器从知识语料库中获取相关段落,然后将其输入基于Transformer的生成器。这些系统在解码过程中通常采用束搜索或top-p采样来生成答案。
知识图谱嵌入的整合也已被探索,其中模型学习对图结构进行推理。例如,一些工作使用图神经网络从检索到的实体传播信息,从而实现多跳推理。这些方法对于需要组合多个事实的问题特别有用,例如“谁是这个演员主演的电影的导演?”
评估与基准
KVQA的标准基准包括FVQA、KVQA和OK-VQA。FVQA(2016年)包含约2000个问题,知识库有50,000个事实。KVQA(2018年)有超过18,000个关于1,800位名人和地标的问题,答案来自Freebase。OK-VQA(2019年)更大,有超过14,000个需要外部知识的问题,但它不提供特定知识库,使其更具挑战性。较新的基准,如A-OKVQA(2022年),通过多项选择和开放式问题扩展了这一点,并包含图像标题和外部事实的知识库。
评估指标通常包括准确率(精确匹配或多项选择正确性),对于生成模型,还包括CIDEr或BLEU等指标。然而,这些指标往往无法捕捉推理质量,并且关于模型是真正推理还是仅仅记忆模式存在持续争论。一些研究人员提出了诊断数据集,用于测试特定推理能力,例如组合问题或需要训练分布之外知识的对抗性示例。
应用与未来方向
KVQA在辅助技术(帮助视障用户理解其环境)、教育(回答关于历史图像或科学图表的问题)和电子商务(基于图像提供产品信息)等领域具有实际应用。在医学领域,KVQA可以通过回答需要解剖学或疾病知识的扫描相关问题来辅助放射科医生,尽管这仍是一个活跃的研究领域。
未来方向包括提高知识检索的可靠性、减少生成模型中的幻觉,以及开发更好地反映现实世界复杂性的基准。此外,人们还关注使KVQA模型更具可解释性,允许用户查看用于推导答案的事实。随着生成式人工智能的持续进步,KVQA很可能成为多模态助手的标准组件,使其能够利用世界知识回答广泛的视觉问题。