译自英文

MMQA是一个多模态问答数据集,结合了文本、图像、表格和视频,用于评估AI模型跨多种模态回答复杂问题的能力,由Facebook AI Research于2019年提出。

MMQA(多模态问答)是一个基准数据集,旨在评估人工智能系统在回答需要跨多种数据类型(包括文本、图像、表格和视频)进行推理的问题时的能力。该数据集由Facebook AI Research(现为Meta AI的一部分)的研究人员于2019年提出,解决了早期问答基准仅关注单一模态(如纯文本或纯图像输入)的局限性。MMQA提供了多样化的问题和相应答案,要求整合来自不同来源的信息,推动机器学习深度学习模型向更接近人类理解的方向发展。

该数据集的创建旨在支持开发能够处理现实世界查询的模型,这些查询中信息分散在各种格式中。与传统假设单一信息源的数据集不同,MMQA要求系统同时定位、组合并推理来自多种模态的证据。这使其成为神经网络架构(尤其是基于Transformer模型的架构)的具有挑战性的测试平台,而Transformer模型已成为自然语言处理和多模态理解中的主导方法。

构建与组成

MMQA通过收集众包工作者的问题构建而成,这些工作者被展示一组维基百科文章,每篇文章包含文本、图像、表格,有时还有视频。工作者被要求生成只能通过结合至少两种不同模态的信息来回答的问题。例如,一个问题可能需要阅读统计表格并查看图像以推断关系,或者观看视频片段并阅读文本段落以回答事实性查询。

最终数据集包含超过12,000个问答对,每个问题链接到特定的维基百科页面。答案是从源内容中提取的短文本片段,通常为几个词。数据集分为训练集、验证集和测试集,其中测试集用于官方评估。问题设计复杂,通常需要多步推理,这使得该数据集比SQuAD或VQA等单模态基准显著更难。

评估与指标

模型在MMQA上的评估使用标准问答指标,主要是精确匹配(EM)和F1分数。EM衡量模型预测答案与真实答案完全匹配的问题百分比,而F1计算预测与真实答案之间标记的重叠,允许部分得分。由于答案是短片段,这些指标提供了准确性的直接度量。

要在MMQA上取得成功,模型不仅需要单独理解每种模态,还需要学会跨模态对齐和融合信息。这需要复杂的架构,能够将图像、表格和视频编码到共同的表示空间中,通常使用预训练的视觉和语言模型。早期基线(如简单拼接特征)表现不佳,凸显了对更高级多模态融合技术的需求。

影响与相关工作

MMQA影响了后续多模态理解研究,并已被众多研究用作基准。它常与视觉问答(VQA)和TextVQA等其他多模态数据集一起被引用,但由于包含表格和视频(这些在其他基准中较少见),它脱颖而出。该数据集推动了能够联合推理文本和图像的模型的发展,后来的扩展还融入了音频和其他模态。

MMQA的发布恰逢大型语言模型生成式人工智能系统的兴起,这些系统在多模态任务中展现出非凡能力。然而,截至2024年,即使是最先进的模型仍发现MMQA具有挑战性,尤其是对于需要对表格或视频进行细粒度推理的问题。这使得MMQA成为评估人工智能系统在现实场景中鲁棒性的宝贵压力测试。

局限性与未来方向

MMQA的一个局限性是它依赖维基百科文章,这些文章主要以英语为主,并带有西方中心偏见。这限制了数据集中所代表的文化和语言背景的多样性。此外,答案被限制为短片段,可能无法捕捉某些需要更长解释的问题的全部复杂性。

该领域的未来工作可能涉及将MMQA扩展到更多语言、更多样化的来源和更长形式的答案。研究人员还在探索如何使模型更具可解释性,以便它们能够解释答案背后的推理过程。随着多模态人工智能的持续发展,像MMQA这样的数据集仍将是衡量进展和识别模型在人类级理解方面仍存在不足之处的关键。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:question-answering·multimodal-dataset·benchmark·natural-language-processing
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史