译自英文

RefCOCO是一个用于指代表达理解的数据集,基于MS COCO图像构建,包含自然语言短语和边界框标注,用于训练和评估视觉-语言模型。

RefCOCO是计算机视觉和自然语言处理领域中广泛使用的数据集,用于指代表达理解任务。它包含来自微软常见对象上下文(MS COCO)数据集的图像,每张图像配有用自然语言表达的指代表达,用于识别图像中的特定对象,并附有相应的边界框标注。该数据集旨在支持将语言映射到视觉对象的研究,这是系统通过语言理解和交互视觉场景的基本能力。

该数据集由加州大学伯克利分校的研究人员创建,并于2014年首次发布。它包含超过50,000条指代表达,涵盖近20,000个对象,分布在约19,000张图像中。这些表达通过类似游戏的界面收集,标注者以能唯一识别图像中对象的方式描述对象,确保短语具有上下文相关性和区分性。RefCOCO已成为评估指代表达理解模型的标准基准,其目标是根据给定短语定位所描述的对象。

结构与标注

RefCOCO基于MS COCO数据集构建,该数据集提供具有实例级分割掩码的多样化图像集。RefCOCO中的指代表达是简短的自然语言短语,通常为一到几个词,通过对象的属性、位置或与其他对象的关系来描述对象。例如,短语可能是“左边的红色汽车”或“拿着伞的女人”。每个表达都配有一个紧密包围所指对象的边界框。标注被分为训练集、验证集和测试集,其中测试集进一步分为两个子集(TestA和TestB),以评估对不同类型表达的泛化能力。

标注过程采用两阶段方法。首先,标注者被展示图像并要求识别所有感兴趣的对象,这些对象随后被标记为MS COCO分类法中的类别。其次,另一组标注者被要求以能让其他人唯一识别的方式描述每个对象。这一过程确保了表达的自然性和多样性,捕捉了人类在上下文中指称对象的方式。

任务定义

与RefCOCO相关的主要任务是指代表达理解,也称为视觉定位。给定图像和自然语言表达,模型必须输出一个边界框来定位所指对象。该任务要求模型理解视觉内容和语言的语义,包括属性、空间关系和对象类别。RefCOCO还支持指代表达生成的关联任务,其中模型必须为图像中的给定对象生成自然语言描述。

理解任务的评估指标通常包括不同交并比(IoU)阈值下的准确率,例如IoU > 0.5,其中预测边界框必须与真实框重叠超过一半。该指标衡量定位精度以及正确识别干扰项中目标对象的能力。

影响与使用

RefCOCO在推动视觉语言理解研究方面发挥了重要作用。它已被用于训练和评估众多模型,从基于Deep learningNeural network架构的早期方法到更近期的基于Transformer (architecture)的模型。该数据集还催生了变体,如RefCOCO+和RefCOCOg,它们在指代表达的风格和复杂性上有所不同。RefCOCO+侧重于描述外观而不涉及位置的表达,而RefCOCOg包含更长、更具描述性的短语。

该数据集通常与其他基准结合使用,以评估集成视觉输入的Large language model系统的性能,例如由OpenAIGoogle DeepMind等组织开发的系统。它作为Generative AI模型的测试平台,这些模型需要将语言映射到视觉数据,这一能力对于图像字幕生成、视觉问答和人机交互等应用至关重要。

挑战与局限性

尽管使用广泛,RefCOCO存在某些局限性。图像来自MS COCO,主要包含常见对象的日常场景,限制了领域的多样性。指代表达相对简短,可能无法捕捉自然语言的完整复杂性,如语用或模糊引用。此外,数据集偏向某些对象类别和空间配置,这可能导致在其上训练的模型过拟合。

研究人员通过创建扩展版本或使用RefCOCO作为预训练步骤,再在更具挑战性的数据集上进行微调,来解决其中一些问题。该数据集仍是评估视觉定位核心能力的标准,其持续使用反映了它在Artificial intelligence领域的重要性。

相关工作与扩展

RefCOCO启发了指代表达理解和生成的一系列研究。许多模型被提出,结合视觉特征与语言嵌入,通常使用注意力机制将单词与图像区域对齐。该数据集也被用于研究上下文的作用,例如干扰对象对理解难度的影响。像RefCOCOg这样的扩展提供了更复杂的表达,其他数据集也被创建用于视频或3D场景中的指代表达,但RefCOCO仍是一个基础资源。

RefCOCO的发展与Machine learningcomputer vision的更广泛趋势一致,其中大型标注数据集对于训练和评估模型至关重要。它一直是社区的关键资源,支持可重复的比较并推动多模态理解的进展。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·vision-language·referring-expression
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史