Flickr30k Entities是一个用于短语定位(phrase grounding)的数据集,该任务旨在将描述文字中的自然语言短语与图像中的对应区域关联起来。它是在Flickr30k图像描述数据集的基础上扩展而来,添加了将文本中实体的提及与其视觉位置联系起来的详细标注。该数据集广泛用于计算机视觉和多模态机器学习研究,用于训练和评估必须理解语言与视觉内容之间关系的模型。
该数据集包含31,783个边界框,用于定位图像中名词短语的视觉指代对象。它还提供了244k条共指链,将同一实体在单张图像的多个描述中的不同提及分组。这种结构使研究人员不仅能够研究直接的短语-区域对齐,还能研究多模态语境下的跨句共指消解。标注覆盖了日常物体、人物和动物的广泛词汇,使该数据集成为接地语言理解(grounded language understanding)的现实基准。
标注结构
Flickr30k Entities中的每张图像都与五条独立的人工撰写的描述相关联。标注者识别出这些描述中的名词短语,并在图像中存在视觉指代对象时,将每个短语链接到一个边界框。当同一实体被多次提及(无论是在单条描述内还是跨五条描述)时,这些提及会被分组为一条共指链。这种设计使得模型能够在短语定位和实体级推理两个层面进行评估,其中模型必须聚合来自多个文本引用的证据。
边界框是轴对齐的矩形,紧密包围所引用的对象。该数据集不提供分割掩码,而是侧重于足以满足定位任务的粗略定位。共指链对于需要模型跨不同描述跟踪实体的任务(如基于实体状态的视觉问答或图像检索)至关重要。
构建与统计
该数据集建立在原始Flickr30k语料库之上,该语料库包含从照片分享网站Flickr收集的31,783张图像。这些图像描绘了各种场景,包括从事活动的人物、动物和日常物体。实体标注通过众包流程生成,并采取了质量控制措施以确保一致性。最终数据集包含244k条共指链和31,783个边界框,平均每张图像约有一个边界框,但许多图像包含多个实体。
一个显著特点是包含了指向图像中未视觉呈现的实体的短语。这些短语被标记出来,使模型能够学习区分有接地引用和无接地引用。这一方面对于现实应用很重要,因为描述可能提及画面之外的物体。
研究用途
Flickr30k Entities已成为短语定位和指代表达理解的标准基准。模型通常根据其为给定名词短语预测正确边界框的能力进行评估。该数据集已被用于训练和测试各种架构,包括基于Transformer模型和神经网络方法的架构。它也是评估基于大语言模型的视觉-语言系统的常见组成部分,这些系统通常使用该数据集来衡量细粒度视觉理解能力。
研究人员已使用该数据集开发弱监督定位方法(模型从图像-描述对中学习,无需显式边界框监督)以及全监督定位方法。共指标注还推动了多模态共指消解的研究,该任务将语言共指与视觉证据相结合。该数据集补充了Visual Genome和referitgame等其他资源,每种资源提供不同的标注粒度和挑战。
局限性与扩展
该数据集继承了原始Flickr30k收集中的偏差,其往往偏向西方、消费导向的摄影内容。描述相对较短,且侧重于显著物体,可能无法反映更专业领域的复杂性。边界框较为粗略,无法捕捉遮挡或部件级细节。尽管存在这些局限性,该数据集因其规模以及共指标注的丰富性,仍然是一项宝贵的资源。
已提出了多种扩展方案,包括为数据集增加额外属性,或利用它生成其他任务的合成训练数据。该数据集也被纳入更大的基准中,这些基准结合多个定位数据集以测试跨领域的泛化能力。截至2020年代初,它仍在计算机视觉和自然语言处理的数百篇论文中被引用。
参见
- phrase-grounding
- Visual Genome
- referitgame
- image-captioning