译自英文

ReferIt是一个用于指代表达式定位的数据集,包含带有相关自然语言短语和对应区域标注的图像。它支持视觉定位和人机交互领域的研究。

ReferIt是一个用于指代表达式定位(referring expression grounding)的数据集,该任务将自然语言描述与图像中的特定区域相关联。它被引入以促进视觉定位、人机交互和多模态推理等领域的研究。该数据集将图像与自然语言指代表达式配对,并提供边界框标注,以指定每个表达式对应的目标区域。

该数据集包含近20,000张图像和超过130,000条指代表达式。图像收集自ImageNet,表达式则通过协作式人机游戏收集,这确保了所用语言自然且面向任务,反映了真实世界的交互场景。ReferIt中的每个表达式都配有分割或边界框标注,用于标记该短语所指的真实区域。

任务定义

在指代表达式定位任务中,模型被给予一张图像和一个指代表达式,例如“桌上的红色杯子”。目标是输出与描述匹配的图像区域。此任务不同于标准目标检测,因为表达式可以描述人类可识别的任何对象或区域,且没有预定义的对象类别集合。评估模型在ReferIt上的性能通常涉及测量预测区域与真实标注之间的交并比(IoU),其中IoU大于0.5的常见阈值被视为正确定位。

数据集构建

ReferIt的构建涉及两个主要组成部分。首先,从ImageNet数据库中收集了一组图像,确保涵盖多样化的日常场景和对象。其次,指代表达式通过一种类似Pictionary的游戏生成,其中一名玩家描述一个对象,另一名玩家必须识别它。此过程允许收集自然、多样且有时模糊的短语。然后,图像被标注为分割掩码,随后转换为边界框用于评估目的,尽管数据集的某些变体保留掩码标注用于分割任务。

模型架构与方法

大多数现代方法在ReferIt上处理指代表达式定位涉及深度学习模型,特别是基于Artificial intelligenceMachine learning的模型。标准流程采用Neural network,同时编码视觉和文本模态。通常,预训练的卷积网络(如Residual Network (ResNet))用于图像特征提取,而Transformer (architecture)或循环网络编码文本。这些表示随后被融合,定位模块预测边界框或掩码。

许多模型采用两阶段方法,首先由目标检测器生成区域提议,然后与查询表达式匹配。或者,最近的改进使用完全可微的框架,直接从融合特征预测坐标,通常借助Multi-Head Attention机制。截至2024年,ReferIt上的最先进结果已通过大规模预训练视觉语言转换器报告,这些转换器利用大量数据并在数据集上进行后续微调。

应用

ReferIt为评估需要将语言与视觉世界相关联的模型提供了基准,这对于人机交互、交互式图像编辑和增强现实等任务至关重要。它也被用作结合Computer vision和自然语言处理的系统的训练源,包括集成式多模态助手。该数据集催生了后续任务,包括视觉共指消解和指代表达式生成,其中模型生成描述给定区域的语言。

影响与局限性

ReferIt已在研究社区中被广泛采用,成为与其他类似数据集并列的标准基准之一。其主要局限性包括与现代大规模视觉数据集相比图像数量相对较少,以及对自然场景的偏向,这可能无法泛化到极其专业化或工业化的图像领域。然而,其现实性和自然语言结构继续推动定位算法的发展。它也是评估词汇外和泛化能力的基础,因为表达式可以任意复杂。

相关资源

指代表达式定位领域已发展成为多模态学习的一个子领域,ReferIt的原则已被纳入更全面的数据集和基准中。这些现在包括视频定位数据集和组合任务,将语言与图像中的对象及时间事件相关联。基于人类反馈的强化学习也已在此类设置中探索,以提高定位准确性,如Reinforcement Learning from AI Feedback (RLAIF)所述。融合视觉和语言的核心概念也是更新架构的关键,例如Large language modelEncoder-Decoder ArchitectureCross-Attention机制。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·natural-language-processing·dataset·grounding
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史