Traducido del inglés

RefCOCOg es un conjunto de datos de comprensión de expresiones referenciales construido sobre el conjunto de imágenes COCO, que presenta descripciones en lenguaje natural más largas y naturales para tareas de anclaje visual en la investigación de IA.

RefCOCOg es un conjunto de datos para la comprensión de expresiones referenciales, una tarea en visión por computadora y procesamiento de lenguaje natural donde un sistema debe localizar un objeto específico en una imagen basándose en una descripción textual. Fue introducido como una extensión del conjunto de datos RefCOCO anterior, con un enfoque en frases más largas y descriptivas que se asemejan al lenguaje generado por humanos. El conjunto de datos se basa en la colección de imágenes Microsoft COCO (Common Objects in Context), que contiene más de 330,000 imágenes con anotaciones detalladas de objetos.

La distinción principal de RefCOCOg radica en sus descripciones. A diferencia de conjuntos de datos anteriores que a menudo usaban frases cortas basadas en plantillas, RefCOCOg proporciona oraciones más largas y naturales que incluyen información contextual, relaciones espaciales y detalles de atributos. Por ejemplo, una descripción podría ser "el hombre con camisa azul de pie junto al coche rojo", en lugar de simplemente "el hombre". Esto hace que el conjunto de datos sea más desafiante y realista para evaluar modelos que deben comprender tanto el contenido visual como el matiz lingüístico.

Construcción del Conjunto de Datos

RefCOCOg fue creado por investigadores de la Universidad de Carolina del Norte en Chapel Hill y se presentó por primera vez en un artículo de 2016. El conjunto de datos se ensambló utilizando una plataforma de crowdsourcing, donde se mostraban a los trabajadores imágenes de COCO y se les pedía que escribieran descripciones que identificaran de manera única un objeto específico dentro de la imagen. Las instrucciones enfatizaban generar frases naturales y similares a las humanas en lugar de usar plantillas predefinidas. Este proceso resultó en aproximadamente 104,560 expresiones referenciales para 54,822 objetos en 26,711 imágenes.

El conjunto de datos se divide en conjuntos de entrenamiento, validación y prueba. Una división común, denominada RefCOCOg-google, utiliza una división 90/10 para entrenamiento y validación, con un conjunto de prueba separado. Otra división, RefCOCOg-umd, fue propuesta posteriormente por investigadores de la Universidad de Maryland, proporcionando una distribución más equilibrada de imágenes entre las divisiones. La elección de la división puede afectar significativamente la evaluación del modelo, ya que diferentes divisiones pueden tener niveles variables de dificultad.

Evaluación y Métricas

La evaluación estándar para RefCOCOg utiliza la métrica de precisión, donde una predicción se considera correcta si el cuadro delimitador predicho tiene una intersección sobre unión (IoU) con el cuadro de referencia que supera un umbral, típicamente 0.5. Algunas evaluaciones también informan la precisión en umbrales de IoU más altos, como 0.75, para evaluar la precisión de localización. La tarea a menudo se enmarca como un problema de clasificación, donde el modelo debe seleccionar la región correcta de un conjunto de propuestas candidatas generadas por un detector de objetos.

Impacto en la Investigación de IA

RefCOCOg se ha convertido en un punto de referencia para el anclaje visual y la comprensión multimodal. Se utiliza ampliamente para evaluar modelos que combinan visión y lenguaje, incluidos aquellos basados en arquitecturas transformador y modelos de lenguaje grandes. El conjunto de datos ha impulsado el progreso en áreas como el subtitulado a nivel de región, la respuesta a preguntas visuales y la generación de expresiones referenciales. Muchos enfoques modernos utilizan técnicas de aprendizaje profundo, incluidos los backbones de redes residuales y mecanismos de atención de múltiples cabezas, para abordar los desafíos planteados por las descripciones más largas del conjunto de datos.

El conjunto de datos también sirve como base para tareas relacionadas, como la segmentación de expresiones referenciales, donde el objetivo es producir una máscara a nivel de píxel en lugar de un cuadro delimitador. Los investigadores han extendido RefCOCOg para crear nuevos puntos de referencia, incluidos aquellos con elementos temporales o interactivos, aunque el conjunto de datos original sigue siendo un punto de referencia estándar.

Limitaciones y Desafíos

A pesar de su utilidad, RefCOCOg tiene limitaciones conocidas. Las descripciones, aunque más largas que las de conjuntos de datos anteriores, siguen siendo relativamente cortas en comparación con párrafos completos de lenguaje natural. El conjunto de datos también hereda sesgos de COCO, como una sobrerrepresentación de categorías de objetos comunes y un enfoque en escenas cotidianas. Además, las descripciones generadas por crowdsourcing pueden ser ambiguas o depender de un contexto que no siempre es visualmente evidente, lo que hace que la tarea sea difícil incluso para anotadores humanos en algunos casos.

Otro desafío es el propio protocolo de evaluación. Usar un umbral de IoU fijo puede no capturar completamente la calidad de la localización de un modelo, especialmente para objetos pequeños o aquellos con formas irregulares. En los últimos años, los investigadores han propuesto métricas y marcos de evaluación más robustos, pero la métrica de precisión original sigue siendo la más comúnmente reportada.

Direcciones Futuras

RefCOCOg sigue siendo relevante como banco de pruebas para nuevos métodos de IA. Con el auge de la IA generativa y los modelos multimodales, el conjunto de datos se utiliza a menudo para sondear cómo estos sistemas pueden anclar el lenguaje en el contenido visual. El trabajo futuro puede implicar extender el conjunto de datos con descripciones más diversas, incorporar video o escenas 3D, o integrarlo con otros puntos de referencia para crear suites de evaluación más completas. Las lecciones aprendidas de RefCOCOg probablemente informarán el desarrollo de conjuntos de datos de anclaje visual de próxima generación que reflejen mejor la complejidad del lenguaje y la visión del mundo real.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·natural-language-processing·visual-grounding
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial