MultimodalQA是一个基准数据集,旨在评估必须对文本和视觉两种模态中呈现的信息进行推理的问答系统。该数据集的引入是为了解决早期数据集仅关注纯文本或纯图像问答的局限性,为人工智能系统提供了一个更真实、更具挑战性的测试平台。该数据集以其异构标注的使用而著称,这意味着数据集中的不同问题需要不同类型的推理,例如结合文本段落和图像中的信息,或执行涉及两种模态顺序进行的多步推理。
MultimodalQA的主要目标是推动机器学习和深度学习中多模态理解的发展。与可能仅需要在单一来源中定位答案的简单基准不同,MultimodalQA包含的问题要求复杂的推理,例如跨模态比较信息、对从图像中提取的数据执行算术运算,或遵循在文本和视觉证据之间交替的推理链。这种设计使其成为研究人员开发和评估旨在整合视觉与文本理解的大型语言模型及其他神经网络架构的宝贵资源。
数据集结构与组成
MultimodalQA基于WebQA数据集构建,后者本身包含源自维基百科文章的问题和答案。MultimodalQA的创建者从WebQA的数据中选取了一个子集,并增加了额外的问答对,以创建一个更平衡、更具挑战性的基准。该数据集分为训练集、验证集和测试集,其中测试集进一步分为公开测试集和用于官方评估的隐藏测试集。隐藏测试集对于防止过拟合以及确保模型能够很好地泛化到未见数据尤为重要。
MultimodalQA的一个关键特征是根据所需推理类型对问题进行分类。数据集包含诸如“文本+图像”等类别,其中答案需要结合文本段落和图像中的信息,以及“多步”类别,其中问题需要一系列推理步骤,可能涉及多个来源。其他类别包括仅“图像”和仅“文本”问题,它们作为对照组,用于在同一框架内衡量模型在单模态任务上的表现。这种分类使研究人员能够详细分析其模型的特定优势和劣势。
评估与指标
MultimodalQA的主要评估指标是准确率,定义为模型预测答案与真实答案完全匹配的问题所占的百分比。对于具有多个可接受答案的问题,如果预测与提供的任何答案匹配,则视为正确。该数据集还包括一个“人类表现”基线,该基线由人类标注者回答部分问题而建立。该基线为评估人工智能系统在此任务上接近人类水平表现的程度提供了参考点。
在介绍MultimodalQA的原始论文中,作者评估了几个基线模型,包括一个基于VisualBERT架构改编的多模态Transformer模型。该模型采用后期融合方法结合视觉和文本特征,在隐藏测试集上取得了约46.伟的准确率,显著低于约88.伟的人类表现。这一巨大差距凸显了该基准的难度,并强调了人工智能系统需要更复杂的推理能力。
意义与影响
MultimodalQA已成为多模态人工智能研究领域广泛使用的基准。许多研究团队和公司,包括主要科技公司和学术机构的团队,都采用该数据集来评估其模型的性能。该数据集对异构推理的强调推动了超越简单特征拼接的新架构和训练技术的发展。例如,一些后续工作探索了使用模块化神经网络来动态路由视觉和文本编码器之间的信息,而其他工作则研究了使用外部知识库来支持推理。
该基准也为人工智能评估的更广泛讨论做出了贡献。通过证明在单模态基准上的高性能并不一定转化为多模态任务上的成功,MultimodalQA鼓励社区开发更全面的评估套件。它还被用作更大基准的组成部分,例如SuperGLUE套件的多模态版本,进一步巩固了其作为评估人工智能能力标准工具的地位。
局限性与未来方向
尽管有其优势,MultimodalQA仍存在某些局限性。该数据集主要以英语为主,且源自维基百科,这可能无法完全捕捉现实世界多模态数据的多样性。此外,问题虽然具有挑战性,但仍然相对简短,可能无法反映交互式环境中自然人类查询的复杂性。研究人员指出,该数据集对精确匹配准确率的依赖可能较为脆弱,因为它不考虑语义等价但措辞不同的答案。
未来多模态问答的工作可能会通过创建具有更多样化来源、更长且更具对话性的问题以及更灵活的评估指标的数据集来解决这些局限性。同时,人们也越来越关注使用具有集成视觉能力的大型语言模型,例如由OpenAI和Google DeepMind等组织开发的模型,来应对像MultimodalQA这样的基准。随着这些模型的不断改进,预计人工智能与人类在MultimodalQA上的表现差距将会缩小,尽管该基准在未来几年内仍可能作为衡量多模态推理进展的宝贵工具。