VSWinoground是一个基准数据集,旨在评估视觉语言模型的视觉空间推理能力。它于2023年由多伦多大学及其他机构的研究团队引入,团队成员包括Tristan Thrush、Ryan Jiang等人。该数据集建立在Winoground基准之上,后者测试文本-图像对中的组合理解,但VSWinoground特别聚焦于空间关系,如“上方”、“下方”、“左侧”和“右侧”。
该基准包含400个图像-标题对,每个对有两个标题,描述同一图像但物体空间排列不同。例如,一个标题可能写“猫在狗上方”,而另一个写“狗在猫上方”。模型的任务是为给定图像选择正确的标题,反之亦然。该数据集公开可用,并已被多项研究用于评估模型性能。
设计与评估
VSWinoground采用半自动化流水线构建,从合成3D场景生成图像,确保对空间布局的精确控制。每个图像渲染两个物体,置于特定空间关系中,标题则使用模板生成。基准包括“文本到图像”和“图像到文本”两种检索任务,模型按每个任务的准确率评分,同时还有一个组合“组”分数,要求模型对给定配对在两项任务上均表现正确。
对包括CLIP和ViLT在内的多个最先进模型的初步评估显示,它们在图像到文本任务上的表现仅略优于随机水平(约50%准确率),而在文本到图像任务上则明显更差。例如,CLIP在图像到文本上达到约52%准确率,在文本到图像上为48%,而ViLT在两项任务上均约为50%。这些结果凸显了当前模型在视觉空间推理上的困难。
相关基准
VSWinoground属于更广泛的Winoground风格基准家族,这些基准测试组合和空间理解。原始Winoground数据集由Google DeepMind的研究人员于2022年引入,包含400个图像-标题对,涵盖更一般的组合变化。其他相关基准包括VSR(视觉空间推理),它使用真实图像并聚焦于空间关系,以及较新的Winoground-V2,它扩展了原始数据集。这些基准常被一起使用,以评估视觉语言模型的鲁棒性。
局限性与批评
VSWinoground的一个局限性是其规模相对较小(400对),可能导致评估结果方差较高。此外,由于图像是合成的,它们可能无法完全捕捉真实世界空间推理的复杂性。一些研究人员认为,该基准对简单空间介词的聚焦可能无法反映实际应用中所需的全范围空间推理。尽管如此,VSWinoground仍是探测模型能力的广泛引用资源。
影响与未来方向
VSWinoground已被多项研究用于分析视觉语言模型的局限性,特别是在大型语言模型和多模态学习的背景下。它还启发了改进空间推理的后续工作,例如引入显式空间编码或使用合成数据增强。截至2025年,尚无模型在该基准上达到人类水平的表现,它继续作为人工智能研究社区的一个具有挑战性的测试平台。
参见
- Winoground(原始基准)
- 视觉空间推理
- 视觉语言模型