译自英文

Visual7W是一个大规模视觉问答与定位数据集,于2016年推出,包含超过327,000个问答对,覆盖47,300张图像,问题分为七类W(什么、哪里、何时、谁、为什么、如何),并基于图像区域进行定位。

Visual7W是一个用于视觉问答(VQA)和视觉定位的基准数据集,由斯坦福大学的研究人员于2016年首次提出。它包含来自Microsoft COCO的47,300张真实世界图像,以及超过327,000个问答对,每个问答对都配有一个或多个边界框,用于定位支持答案的视觉证据。该数据集以强调定位而著称,要求模型不仅回答问题,还要识别相关的图像区域,这一能力对于可解释的AI系统至关重要。

Visual7W的名称源于其涵盖的七类问题:什么、哪里、何时、谁、为什么和如何,其中“哪个”作为第七类被添加,以处理对象选择任务。与早期主要关注对象识别的VQA数据集不同,Visual7W包含大量“为什么”和“如何”类问题,这些问题要求对场景中的因果和程序性关系进行推理。这种设计使其成为对深度学习模型的严格测试,因为它弥合了感知与更高层次认知之间的鸿沟。

数据集结构

Visual7W由两个主要部分组成:多项选择问答和开放式问答。多项选择子集为每个问题提供四个候选答案,而开放式子集则要求自由形式的生成。每个问题都标注有一个定位框,即围绕包含答案的图像区域的边界框。数据集分为训练集、验证集和测试集,其中测试集又分为公开部分和用于官方评估的隐藏部分。

所有图像均来自Microsoft COCO数据集,确保场景多样,包含日常物体和活动。标注通过Amazon Mechanical Turk收集,并采用质量控制措施来过滤模糊或不正确的问题。平均问题长度约为8个单词,词汇量覆盖约4,000个单词,使其成为神经网络模型的一个紧凑但具有挑战性的语言空间。

任务形式化

Visual7W中的主要任务是视觉定位,即模型接收图像和问题,必须输出答案和边界框。这被形式化为一个联合预测问题:模型必须定位回答问题的区域,然后基于该区域分类或生成答案。评估指标包括答案准确率和定位准确率,其中定位通过预测框与真实框之间的交并比(IoU)来衡量。

次要任务是不带定位的视觉问答,这允许与先前数据集进行比较。然而,定位要求使Visual7W特别适合研究注意力机制,因为模型必须学会关注图像的相关部分。这影响了后续架构,例如使用多头注意力交叉注意力层的架构,这些现在已成为基于Transformer的视觉-语言模型的标准。

基准意义

Visual7W是首批强调“为什么”和“如何”类问题的VQA基准之一,这些问题需要超越简单模式匹配的常识推理。例如,像“为什么这个人拿着伞?”这样的问题要求理解天气背景和因果推断。这推动了该领域向更复杂的大型语言模型和视觉-语言预训练方法发展。

该数据集已被用于评估众多模型,从早期的残差网络结合循环网络到现代的生成式AI系统。它也是Visual Genome和GQA等更大基准的先驱,这些基准扩展了关系推理的范围。斯坦福AI实验室伯克利AI研究等机构的研究人员已使用Visual7W来测试可解释性和注意力可视化技术。

局限性与批评

尽管有其贡献,Visual7W存在已知的局限性。定位框通常较粗糙,覆盖的区域大于所引用的特定对象,这可能会夸大定位准确率。该数据集还存在语言偏差,即某些答案与问题类型相关,使模型能够利用捷径而无需真正的视觉理解。此外,“为什么”和“如何”类问题相对于“什么”和“哪里”类问题较少,限制了推理评估的深度。

批评者指出,多项选择格式可能被统计规律性所利用,而开放式答案通过精确字符串匹配进行评估,这会惩罚语义正确但改写过的回答。这些问题促使后续数据集开发了更稳健的评估协议,例如使用RLHF风格的人类反馈进行评分。

遗产与影响

Visual7W仍然是研究视觉定位和问答的宝贵资源,特别是在教育目的和基于注意力的模型基准测试方面。其定位标注已被重新用于视觉常识推理和指代表达理解等任务。该数据集对可解释性的强调与机器学习中向可解释AI发展的更广泛趋势相一致,并且它继续在多模态学习和数据增强策略的研究中被引用。

截至2020年代中期,由于更大、更复杂的数据集的出现,Visual7W作为主要基准的使用频率有所降低,但它仍然是评估基础VQA能力的标准参考。其设计原则影响了自动驾驶和机器人领域数据集的创建,在这些领域中,定位对于安全决策至关重要。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·visual-question-answering·computer-vision·natural-language-processing
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史