译自英文

OK-VQA是一个视觉问答基准测试,旨在评估AI系统回答需要超越图像内容的外部知识的问题的能力,包含14,031个问题,分布在14,031张图像上。

OK-VQA(外部知识视觉问答)是一个用于评估视觉问答(VQA)系统的基准数据集。与早期仅关注可从图像本身回答的问题的VQA数据集不同,OK-VQA特别要求模型结合关于物体、场景和日常概念的外部知识来产生正确答案。该数据集于2019年由佐治亚理工学院的研究人员引入,包括Kenneth Marino、Mohammad Rastegari、Ali Farhadi和Roozbeh Mottaghi,此后已成为研究知识增强型视觉语言模型的标准测试平台。

该基准包含14,031个问题,与14,031张图像配对,每张图像恰好对应一个问题。这些问题设计为无歧义,并且需要视觉上不存在的外部知识。例如,当图像显示一个部分遮挡的生物时,问题可能是“这是什么类型的动物?”,或者对于不熟悉的物体,问题可能是“这个工具有什么用途?”。数据集涵盖广泛的知识领域,包括食物、动物、车辆、运动和家居用品,确保多样性并挑战模型对现实世界背景进行推理的能力。

构建与标注

OK-VQA通过众包方式从Amazon Mechanical Turk工作人员处收集问题。标注过程包括向工作人员展示图像,并要求他们生成一个无法仅通过查看图像回答、但需要常识或事实知识的问题。为确保质量,每个问题由多名标注者验证,只有具有较高标注者间一致性的问题才被保留。最终数据集被划分为训练集(9,009个问题)、验证集(2,016个问题)和测试集(3,006个问题)。测试集通过在线服务器用于官方评估,以准确率作为主要指标。

评估与指标

OK-VQA的标准评估指标是精确匹配准确率,即模型的预测答案如果与某个真实答案完全匹配,则视为正确。每个问题有10个由不同标注者提供的真实答案,预测只要匹配其中任何一个即得分正确。这种方法考虑了人类表达答案时的差异性。模型通常在测试集上进行评估,但研究人员常使用验证集进行开发和超参数调优。

挑战与局限性

OK-VQA对AI系统提出了若干挑战。首先,它要求将视觉信息与广泛的世界知识相结合,这对于主要基于图像-文本对训练的模型来说较为困难。其次,许多问题存在歧义或需要推理隐含背景,例如理解文化习俗或物理属性。第三,该数据集因包含一些尽管设计意图如此、但仅凭图像即可回答的问题而受到批评,并且与其他VQA基准相比规模相对较小。此外,精确匹配指标可能过于严苛,会惩罚语义正确但措辞不同的答案。

影响与应用

OK-VQA已成为Machine learning计算机视觉领域广泛使用的基准。研究人员采用它来评估将视觉编码器与Large language model相结合的模型,通常使用Cross-Attention等技术融合图像和文本表示。许多最先进的视觉语言模型,包括基于Transformer (architecture)架构的模型,将OK-VQA上的性能报告为知识推理能力的关键指标。该数据集还推动了知识检索与整合专门方法的发展,例如整合外部知识库或使用Data Augmentation技术来提高泛化能力。

相关基准

OK-VQA是更广泛的VQA基准家族的一部分。原始VQA数据集于2015年引入,侧重于可从图像内容回答的问题。其他相关基准包括强调关系和属性的Visual Genome,以及测试组合推理的GQA。较新的基准如A-OKVQA通过提供额外答案选项和理由标注扩展了OK-VQA。OK-VQA因其明确聚焦于外部知识而保持独特性,使其成为研究AI中感知与推理交叉领域的独特资源。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:visual-question-answering·benchmark·computer-vision·dataset
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史