VQA v2是一个用于视觉问答(VQA)的大规模数据集,该任务要求模型回答关于图像的自然语言问题。它于2017年作为原始VQA数据集的继任者推出,旨在缓解其前身存在的语言偏差问题。该数据集包含超过110万个问题,涉及超过20万张图像,每个问题都配有一张互补图像,其答案不同,从而迫使模型依赖视觉信息而非语言先验。
VQA v2的创建源于一个观察:许多模型在VQA v1上表现良好,是因为利用了问题中的统计规律,而非真正理解图像。例如,模型可能对大多数“是否存在……”的问题回答“是”,而不考虑图像内容。为解决这一问题,VQA v2数据集通过收集互补的图像-问题对来构建:对于每个问题,额外选择一张图像,使得同一问题在这两张图像上的答案不同。这种平衡设计鼓励开发能够整合视觉和文本推理的模型。
该数据集被广泛用作Machine learning和Deep learning领域的基准,尤其用于评估Neural network架构和注意力机制。它在推动多模态学习研究方面发挥了重要作用,其中模型必须将视觉特征与语言表示对齐。许多最先进的系统,包括基于Transformer (architecture)架构和Large language model的系统,都在VQA v2上进行了评估,通常以准确率作为主要指标。
数据集结构
VQA v2包含来自Microsoft COCO数据集的图像,该数据集涵盖具有多个对象和交互的复杂场景。每张图像关联多个问题,每个问题有10个由人类标注者提供的真实答案。问题是开放式的,涵盖对象存在性、颜色、计数和空间关系等类别。数据集分为训练集、验证集和测试集,其中测试集进一步分为test-dev和test-standard子集,用于评估目的。
VQA v2的关键创新在于其平衡配对:对于每个问题,数据集中至少存在另一张图像,其答案不同。这确保了模型无法通过简单记忆问题-答案模式来获得高准确率。数据集包含约110万个问题,其中训练集约25万张图像,验证集约2.5万张,测试集约2.5万张。
评估指标
准确率是VQA v2的主要指标。对于每个问题,模型的预测答案与10个人类提供的答案进行比较。单个问题的准确率计算为匹配预测的人类答案数除以3的最小值,上限为1。这种评分方案奖励多个标注者一致认可的答案,鼓励模型产生常识性响应。
除总体准确率外,结果通常按问题类型报告,如“是/否”、“数字”和“其他”(开放式)。这种细分有助于识别模型的特定优势和弱点。例如,模型可能在是/否问题上表现出色,但在计数或空间关系推理上存在困难。
研究影响
VQA v2已成为Computer vision和Natural language processing社区的标准基准,尽管提供的链接列表不包含这些slug。它推动了众多Deep learning模型的发展,包括采用注意力机制、Residual Network (ResNet)和Multi-Head Attention层的模型。该数据集还用于研究针对多模态任务定制的Data Augmentation技术和Loss Functions。
VQA v2的平衡设计影响了后续数据集的创建,如Visual Genome和GQA数据集,这些数据集也旨在减少偏差。研究人员使用VQA v2来探索模型在组合推理和视觉基础等领域的 capabilities,从而深入了解当前Artificial intelligence系统的局限性。
局限性与批评
尽管有所改进,VQA v2仍表现出一些偏差。例如,某些问题在数据集中可能具有主导答案,模型可以利用这些先验。此外,该数据集主要关注COCO中的静态图像,可能无法捕捉真实世界视觉场景的多样性。一些批评者认为,问题的开放性导致歧义,且评估指标未考虑语义等价的答案(例如,“car”与“automobile”)。
此外,该数据集因不要求深度推理而受到批评;许多问题可以通过识别对象或属性来回答,而无需复杂推断。这导致了更具挑战性的基准的开发,如VQA-CP(在变化先验下的VQA),它重新划分数据以更明确地暴露语言偏差。
结论
VQA v2仍然是多模态AI研究中的基础资源。其平衡设计为数据集构建树立了新标准,鼓励开发真正整合视觉和文本信息的模型。尽管出现了更新的基准,VQA v2仍被用于评估和比较模型,其影响在后续数据集和任务的设计中显而易见。