RefCOCOg是计算机视觉和自然语言处理领域的一个基准数据集,专为指代表达理解与生成任务而设计。它旨在解决早期指代表达数据集的局限性,特别是对更长、更具描述性且依赖上下文的语言的需求。该数据集为必须将视觉信息与语言描述对齐的模型提供了一个具有挑战性的测试平台,这是人机交互、图像编辑和视觉问答等应用的核心能力。
该数据集包含来自26,711张图像的54,822个对象的104,560条指代表达,所有图像均源自Microsoft COCO(上下文中的常见对象)数据集。RefCOCOg的一个关键特征是,其表达比RefCOCO等先前数据集更长、更自然,通常需要理解场景中多个对象之间的关系。例如,一个表达可能是“站在红色汽车旁边的穿蓝衬衫的男人”,这需要同时定位主要对象及其关系上下文。
构建与标注
RefCOCOg由一组研究人员创建,标注过程涉及人类标注者,他们被要求编写能唯一识别图像中目标对象的描述。标注通过众包平台收集,每条表达都经过验证以确保其无歧义。数据集分为训练集、验证集和测试集,其中测试集根据标注者是否在训练期间看到图像进一步分为两个子集(称为“refexp”和“refexp+”)。这种划分设计有助于评估对未见标注者和语言风格的泛化能力。
任务形式
与RefCOCOg相关的主要任务是指代表达理解,即模型接收图像和文本描述,必须定位所描述的对象,通常通过预测边界框或分割掩码来实现。相关任务是指代表达生成,即模型必须为图像中的给定对象生成自然语言描述。这两个任务均使用标准指标进行评估:理解任务使用交并比(IoU),生成任务使用CIDEr或BLEU等指标。
对模型开发的影响
RefCOCOg已被广泛用于训练和评估深度学习模型,特别是基于Transformer (architecture)架构和Multi-Head Attention机制的模型。早期方法使用Residual Network (ResNet)骨干网络进行视觉特征提取,并结合循环神经网络进行语言编码。更近期的系统利用Large language model和Vision-language model,通常集成Cross-Attention层以融合视觉和文本模态。该数据集对更长表达的强调推动了模型的发展,使其能够推理空间关系、属性和上下文,超越了简单的对象检测。
与其他数据集的关系
RefCOCOg是包括RefCOCO和RefCOCO+在内的指代表达数据集家族的一部分,这些数据集大约在同一时间引入。RefCOCO侧重于较短、更简洁的表达,而RefCOCO+则将表达限制为基于外观的描述,避免使用位置词。RefCOCOg的特点是更长、更对话式的描述,通常需要整体场景理解。这些数据集共同成为该领域的标准基准,排行榜跟踪每个数据集上的最新性能。
挑战与局限性
尽管有其用途,RefCOCOg仍存在已知的局限性。该数据集源自MS COCO,后者偏向常见对象类别和日常场景,可能限制多样性。表达虽然更长,但仍可能无法捕捉真实世界交互中人类指称的全部复杂性,例如使用手势或共享知识。此外,基于边界框的评估可能较为粗糙,某些表达即使对人类也可能存在歧义。研究人员已提出扩展和替代数据集以解决这些差距,但RefCOCOg仍是研究接地语言理解的基础资源。
参见
参考文献
该数据集在论文《Grounded Language Understanding: Referring Expression Comprehension and Generation》中引入,作者为Junhua Mao、Jonathan Huang、Alexander Toshev、Oana Camburu、Alan Yuille和Kevin Murphy,发表于2016年欧洲计算机视觉会议(ECCV)。