译自英文

VQA 2.0是2017年推出的一个平衡的视觉问答数据集,旨在减少语言偏见,从而能够对AI视觉-语言模型进行更稳健的评估。

VQA 2.0是一个用于视觉问答(VQA)的大规模数据集,视觉问答是人工智能中的一项任务,系统必须回答关于图像的自然语言问题。该数据集于2017年由弗吉尼亚理工大学和微软研究院的研究人员发布,旨在解决其前身VQA数据集中的一个关键缺陷:模型通常可以不看图像就正确回答问题,利用问题和答案中的统计规律性。VQA 2.0通过将每个问题与两张答案不同的图像配对来缓解这一问题,迫使模型真正理解视觉内容才能成功。该数据集已成为评估视觉语言模型(包括基于transformer和大语言模型的模型)的标准基准。

最初的VQA数据集于2015年推出,包含来自微软COCO数据集的超过20万张图像和超过60万个问题,每个问题都有多个真实答案。然而,它存在严重的语言偏差:例如,训练集中问题“香蕉是什么颜色?”的答案几乎总是“黄色”,因此模型可以在不处理图像的情况下猜对。2017年发布的VQA 2.0将问题数量翻倍至超过110万个,通过添加互补问题,使不同图像对应不同答案。具体来说,对于原始数据集中的每个问题,创建者添加了第二张图像,使得同一问题在这两张图像上的答案不同。这种平衡设计减少了仅依赖语言的捷径的有效性,并鼓励开发整合视觉和文本信息的模型。

数据集组成与结构

VQA 2.0由来自微软COCO数据集的图像组成,该数据集包含具有多个对象和交互的复杂场景。问题是开放式的,涵盖多种类别,包括对象存在性、颜色、计数和空间关系。每个问题都附有从人类标注者收集的10个真实答案,允许使用基于共识的准确率指标进行评估。数据集分为训练集、验证集和测试集,其中测试集进一步分为test-dev和test-standard用于基准测试。官方评估服务器允许研究人员在隐藏测试集上比较他们的模型,确保公平比较。

VQA 2.0的平衡设计使其成为一个更具挑战性的基准。例如,依赖语言先验的模型可能会对任何香蕉问题回答“黄色”,但VQA 2.0包含香蕉为绿色或棕色的图像,要求模型实际查看图像。这导致了视觉推理方面的显著进展,因为模型必须学会将语言锚定在视觉证据上。

对视觉问答研究的影响

VQA 2.0已成为视觉问答领域使用最广泛的基准之一。它已被用于评估各种模型,从早期神经网络架构到现代基于transformer的视觉语言模型。该数据集还催生了几项后续挑战,例如视觉问答挑战赛,该挑战赛每年在计算机视觉会议上举行。许多最先进的模型,包括基于Transformer (architecture)架构和大语言模型的模型,都将VQA 2.0上的性能作为关键指标报告。

VQA 2.0的一个显著影响是它在强调减少AI数据集偏差方面的重要性。其平衡设计启发了其他领域的类似方法,例如视觉蕴含和视觉推理。研究人员还使用VQA 2.0来研究模型的可解释性,分析模型在回答问题时关注图像的哪些部分。

局限性与批评

尽管有所改进,VQA 2.0并非没有局限性。一些批评者认为,该数据集仍然包含偏差,例如问题倾向于关注常见对象和属性。此外,开放式的答案空间使评估具有挑战性,因为模型必须生成自由形式的答案,并与一组人类答案进行比较。准确率指标将所有答案平等对待,可能无法完全捕捉推理质量。此外,VQA 2.0主要测试识别和简单推理,可能无法充分衡量更高层次的认知能力,如常识或抽象推理。

另一个批评是,VQA 2.0与许多基准一样,即使采用平衡设计,也可能被利用数据中统计模式的模型“钻空子”。例如,模型可能会学习对以“是否有”开头的问题回答“是”,除非有强有力的相反证据。为了解决这些问题,研究人员提出了更具挑战性的基准,例如VQA-CP(变化先验下的VQA),它重新划分数据以进一步减少语言偏差。

与现代视觉语言模型的关系

随着大规模视觉语言模型的兴起,例如由OpenAIGoogle DeepMindAnthropic开发的模型,VQA 2.0已成为标准评估工具。这些模型通常基于transformer架构,并在大规模图像-文本对上预训练,在VQA 2.0上取得了高准确率,有时在某些问题类型上超过人类表现。然而,该基准仍然有助于诊断弱点,例如处理稀有对象或复杂空间推理。截至2025年,VQA 2.0继续在关于Generative AI和多模态学习的论文中被引用,充当计算机视觉和自然语言处理之间的桥梁。

该数据集也已整合到更广泛的评估套件中,例如OpenPanel和其他AI基准测试倡议,这些倡议旨在评估AI系统在多个任务上的能力。VQA 2.0的平衡设计影响了GQA和CLEVR等新数据集的创建,这些数据集专注于组合推理。

结论

VQA 2.0代表了视觉问答系统评估方面的重大进步。通过解决早期数据集固有的语言偏差,它推动了该领域向更稳健和视觉锚定的模型发展。其影响超越了特定任务,影响了AI研究中的数据集设计和评估实践。随着视觉语言模型的不断发展,VQA 2.0仍然是一个相关且具有挑战性的基准,确保AI的进步不仅通过模式识别来衡量,还通过对视觉世界的真正理解来衡量。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·visual-question-answering·computer-vision·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史