译自英文

RefCOCO+是一个用于指代表达理解的数据集,其中自然语言描述在附加位置约束下识别图像中的对象。它通过更复杂的表达扩展了RefCOCO。

RefCOCO+是一个用于指代表达理解的基准数据集,该任务是计算机视觉和自然语言处理中的一项任务,要求系统根据文本描述在图像中定位特定对象。该数据集于2016年由华盛顿大学的研究人员提出,基于Microsoft COCO(上下文中的常见对象)数据集构建,并作为整合视觉与语言理解的模型的标准评估工具。该数据集以其对基于位置的约束的强调而著称,使其比其前身RefCOCO更具挑战性。RefCOCO+包含超过19,000张图像和超过140,000条指代表达,每条表达都配有一个边界框标注。

RefCOCO+的主要区别在于其指代表达,这些表达由人工标注者在特定条件下生成。与原始RefCOCO数据集不同,RefCOCO+禁止使用绝对位置词,如“左”、“右”、“上”或“下”。相反,标注者被鼓励使用相对空间关系(例如,“女人右边的男人”)和基于外观的描述,如颜色、大小或动作。这一约束迫使模型推理对象属性和对象间关系,而不是依赖全局位置线索。该数据集由Yu及其同事创建,他们还引入了一种新颖的评估协议,用于测试模型在不同类型表达上的泛化能力。

数据集结构与标注

该数据集基于MS COCO train2014和val2014分割构建,涵盖了多样化的日常场景。每张图像包含多个对象,指代表达为对象的子集提供,通常是那些视觉上显著的对象。标注包括每个所指对象的手绘边界框以及表达文本。平均而言,每张图像约有7.5条指代表达,每条表达包含约3.5个词。数据集被划分为训练集(90%)、验证集(5%)和测试集(5%),并经过精心策划以确保各分割之间没有重叠图像。一个独特的功能是包含两个测试分割,testA和testB,其中testA包含以人物为主要焦点的表达,testB侧重于非人物对象,从而能够对模型性能进行细粒度分析。

任务定义与评估指标

核心任务是输出一个准确包含输入表达所描述对象的边界框。准确性使用交并比(IoU)指标来衡量,如果预测框与真实框之间的IoU超过0.5,则预测被视为正确。这种基于阈值的评估在指代表达数据集中是标准的。研究人员通常将结果报告为“IoU=0.5时的准确率”,有些还评估精确率-召回率曲线。鉴于位置约束,模型必须有效结合语言解析与视觉特征提取。深度学习方法,特别是使用神经网络的方法,一直占据主导地位,其架构将语言嵌入与感兴趣区域的视觉特征融合。

方法论进展

自发布以来,RefCOCO+推动了多模态推理的重大进展。早期方法使用Sequence-to-Sequence (Seq2Seq)模型生成空间注意力图,而后来工作则引入Multi-Head Attention机制来将词与图像区域对齐。该数据集在视觉语言模型的发展中起到了关键作用,这些模型将任务视为接地问题。 notable贡献包括使用Residual Network (ResNet)骨干网络进行特征提取和Batch Normalization来稳定训练。许多最先进的系统在大规模图像-文本语料库上进行预训练,然后在RefCOCO+上进行微调,利用机器学习。截至2024年,基于transformer的架构,如Transformer编码器-解码器,在testA上已达到超过85%的准确率,反映出相对于初始基线约60%的得分有了显著改进。

与其他数据集的关系

RefCOCO+是指代表达数据集家族的一部分,包括RefCOCO和RefCOCOg,每个数据集都有不同的约束。RefCOCOg提供更长、更自然的表达,没有位置限制,而RefCOCO+介于两者之间,平衡了复杂性和可行性。该数据集已被广泛用于训练和评估系统级AI应用,如自动驾驶和辅助机器人,在这些应用中理解空间参考至关重要。其设计影响了后续基准测试,包括具身AI中的基准测试,其中代理必须在3D环境中遵循指令。社区还采用RefCOCO+进行少样本和零样本学习研究,测试模型是否能泛化到未见过的对象类别。

局限性与未来方向

尽管有其用途,RefCOCO+仍存在局限性。表达相对较短,缺乏自然人类话语的复杂性,且数据集偏向常见对象类别。一些批评者认为位置约束是人为强加的,使任务与现实应用不太一致。为解决这些问题,研究人员提出了具有更丰富标注的新数据集,但RefCOCO+由于其规模和已建立的评估协议,仍然是标准基准。未来工作探索整合Large language model组件以生成更多样化的表达,并使用Data Augmentation技术来提高鲁棒性。截至2025年,该数据集继续作为衡量接地语言理解进展的参考点,与Generative AI等新兴领域(如图像编辑和交互式对话)并列。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:referring-expression·dataset·computer-vision·multimodal
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史