Winoground是一个基准数据集和评估套件,旨在测试视觉-语言模型的组合理解能力。它由多伦多大学等机构的研究人员于2022年提出,并已成为评估模型是否真正理解视觉内容与语言结构之间关系(而非依赖统计捷径或表面相关性)的标准参考点。该基准的名称是“Winograd”(指代自然语言处理中的Winograd Schema Challenge)和“ground”(如将语言锚定到图像)的合成词。
Winoground的核心任务包含400个精心构建的示例。每个示例由两张图像和两个标题组成。这些标题被设计为具有组合挑战性:它们包含相同的单词集,但顺序不同,从而改变含义。例如,一个标题可能是“狗追逐猫”,而另一个是“猫追逐狗”。两张对应的图像分别描绘了每种场景。模型被呈现两张图像和两个标题,必须正确地将每个标题与其对应的图像匹配。成功要求模型解析标题的句法结构,并将其与图像中的视觉关系(如施事-动作-受事角色、空间介词(如“在……上”与“在……里”)或属性-对象配对)对齐。
该基准的创建是为了解决许多视觉-语言模型的一个已知弱点:它们通常在可以通过识别单个对象或利用语言先验来解决的任务上表现良好,但当任务要求理解单词排列如何改变含义时,它们就会失败。例如,模型可能正确识别图像中包含一只狗和一只猫,但可能无法确定哪个动物在执行动作。Winoground为这种能力提供了一个受控测试,并揭示了即使是先进的模型也存在显著差距。
设计与评估
每个Winoground示例根据三个独立的指标进行评分:“标题分数”、“图像分数”和“组分数”。标题分数衡量模型正确地将两个标题分别匹配到其对应图像的比例。图像分数衡量模型正确地将两个图像分别匹配到其对应标题的比例(这是对称的,但由于模型的不对称性可能有所不同)。组分数是最严格的:它要求模型在单次试验中同时正确完成两个标题到图像的匹配,这意味着模型不仅必须识别正确的配对,还必须避免在两个选项之间产生任何混淆。
该数据集由人类标注者构建,他们生成了图像对和标题。标题被设计为最小对,仅在一个特定的组合元素上有所不同。然后,图像被获取或生成以精确匹配每个标题。创建者还过滤了示例,以确保它们不能通过简单的对象检测来解决,并验证了人类标注者能够以接近完美的准确率解决任务,从而建立了人类基线。
结果与发现
对Winoground上突出的视觉-语言模型的初步评估显示,大多数模型的表现处于或接近随机水平(组分数约为25%,因为有两种可能的配对,模型必须选择正确的一种)。例如,像CLIP(对比语言-图像预训练)和其他双编码器架构(将图像和文本嵌入到共享空间)的模型,通常无法区分两个标题。这令人惊讶,因为这些模型在其他基准(如图像标题检索或视觉问答)上取得了高分。这一失败凸显了这些模型并未真正进行组合推理;相反,它们往往依赖于单个对象的存在或单词与视觉特征之间的相关性,而这些并不需要理解关系结构。
后续工作使用Winoground来探究各种模型架构的局限性,包括基于Transformer (architecture)和Large language model(结合视觉编码器)的模型。研究人员发现,具有更复杂注意力机制或通过额外目标(如Cross-Attention或Multi-Head Attention层)训练的模型有时会表现出改进,但即便如此,分数仍远低于人类水平。该基准也被用于研究训练数据规模的影响以及合成数据的使用,一些研究表明,用组合示例增强训练数据可以提高Winoground上的表现,但泛化仍然是一个挑战。
与其他基准的关系
Winoground是测试AI组合泛化的更广泛基准家族的一部分。它在概念上与自然语言处理中的Winograd Schema Challenge相关,后者测试共指消解和常识推理。在视觉-语言领域,它补充了VQA(视觉问答)和图像-文本检索等其他基准,但特别隔离了组合方面。与允许模型使用语言先验或对象共现统计的任务不同,Winoground迫使模型使用标题的精确句法结构。这使其成为研究人员开发新架构(如基于Residual Network (ResNet)或U-Net的图像编码架构)以及训练技术(如Curriculum Learning或Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习))的宝贵诊断工具。
该基准也启发了变体和扩展,例如针对视频或多语言设置的Winoground,尽管这些标准化程度较低。原始数据集是公开可用的,并已被集成到公司和研究实验室使用的多个模型评估套件中,包括OpenAI、Google DeepMind和Anthropic,作为跟踪组合理解进展的一种方式。
局限性与批评
一些研究人员指出Winoground存在局限性。数据集相对较小(400个示例),这可能导致评估结果的高方差,尤其是对于随机性较强的模型。示例均为英文,且侧重于有限的组合现象,如主-谓-宾顺序和空间关系,这可能无法涵盖视觉-语言理解中组合挑战的全部范围。此外,任务的二元性(将两张图像与两个标题匹配)有时可以通过使用简单启发式(如关注单个区分词)的模型来解决,而无需完全理解句子。尽管存在这些批评,Winoground仍然是Artificial intelligence和Machine learning领域中被广泛引用且有影响力的基准,并继续作为新模型和训练方法的标准测试。