译自英文

VQA 1.0是原始的视觉问答数据集和基准,于2015年推出,用于评估AI系统回答关于图像的自然语言问题的能力。

VQA 1.0是视觉问答(VQA)的首个大规模数据集和基准,该任务要求AI系统回答关于图像的开放式问题。该数据集于2015年由弗吉尼亚理工大学和微软的研究人员推出,成为该领域的标准评估集,推动了计算机视觉自然语言处理相结合的研究进展。该数据集包含真实照片及人工标注的问题和答案,旨在测试模型对视觉内容和语言进行推理的能力。

VQA 1.0的创建动机是开发能够以类人方式与视觉世界交互的AI系统。与图像描述等早期任务(生成单一描述性句子)不同,VQA要求回答具体问题,需要更深层次的理解和推理。数据集的设计鼓励模型处理多种问题类型,包括是非题、计数题和开放式查询,并将其答案基于视觉证据。

数据集结构与统计

VQA 1.0包含来自Microsoft COCO数据集的204,721张图像,配以614,163个问题和6,141,630个答案。每张图像关联约三个问题,每个问题由不同的人类标注者提供十个真实答案。问题为开放式,涵盖对象、颜色、计数和空间关系等类别。数据集分为训练集(82,783张图像)、验证集(40,504张图像)和测试集(81,434张图像),其中测试集进一步分为test-dev和test-standard用于评估。

任务定义与评估

在VQA中,模型接收图像和自然语言问题,并必须生成简洁的答案。评估指标为准确率,通过将模型答案与十个人类答案进行比较来计算。如果模型的答案与十个人类答案中的至少三个完全匹配,则该答案被视为正确。该指标称为VQA准确率,旨在考虑人类措辞的变异性。基准还提供按问题类型的细分,使研究人员能够分析在特定类别(如“什么颜色”或“多少个”)上的表现。

基线模型与早期进展

VQA 1.0的初始基线包括简单方法,如最近邻检索和“先验”模型(对给定问题类型始终预测最常见的答案)。这些基线的准确率约为30-40%。首批神经模型结合了用于图像特征的卷积神经网络和用于问题编码的循环神经网络,将性能提升至约55-60%。这些早期系统使用LSTM网络和词嵌入来处理问题,并从预训练的VGG网络中提取图像特征。人类表现(约83%)与机器表现之间的差距凸显了该任务的难度。

影响与遗产

VQA 1.0将VQA任务确立为人工智能中的核心挑战,推动了大量后续数据集和模型的发展。它促成了VQA 2.0的创建(该版本平衡了答案分布以减少语言偏差)以及Visual Genome(增加了区域级标注)。该数据集还影响了GQA和CLEVR等后续基准的设计,这些基准侧重于组合推理。VQA 1.0仍然是评估视觉推理能力的参考点,其方法论已被许多后续多模态基准所采用。

VQA 1.0的发布恰逢深度学习transformer架构的兴起,后者后来在多模态模型中占据主导地位。现代系统(例如基于带视觉编码器的大语言模型的系统)现在在VQA 1.0上已达到接近人类的表现,但该数据集的遗产在于其作为视觉推理和基于语言理解研究催化剂的角色。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·computer-vision·natural-language-processing·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史