RefCOCO es un conjunto de datos ampliamente utilizado en visión por computadora y procesamiento de lenguaje natural para la tarea de comprensión de expresiones referenciales. Consiste en imágenes del conjunto de datos Microsoft Common Objects in Context (MS COCO), cada una emparejada con expresiones referenciales en lenguaje natural que identifican objetos específicos dentro de la imagen, junto con anotaciones de cuadros delimitadores correspondientes. El conjunto de datos fue introducido para apoyar la investigación en la vinculación del lenguaje con objetos visuales, una capacidad fundamental para sistemas que necesitan comprender e interactuar con escenas visuales a través del lenguaje.
El conjunto de datos fue creado por investigadores de la Universidad de California, Berkeley, y fue presentado por primera vez en 2014. Contiene más de 50,000 expresiones referenciales para casi 20,000 objetos en aproximadamente 19,000 imágenes. Las expresiones se recopilan mediante una interfaz similar a un juego donde los anotadores describen objetos de una manera que los identifica de forma única dentro de la imagen, asegurando que las frases sean contextualmente relevantes y discriminativas. RefCOCO se ha convertido en un estándar de referencia para evaluar modelos que realizan comprensión de expresiones referenciales, donde el objetivo es localizar el objeto descrito por una frase dada.
Estructura y Anotación
RefCOCO se basa en el conjunto de datos MS COCO, que proporciona un conjunto diverso de imágenes con máscaras de segmentación a nivel de instancia. Las expresiones referenciales en RefCOCO son frases cortas en lenguaje natural, típicamente de una a pocas palabras, que describen un objeto por sus atributos, ubicación o relación con otros objetos. Por ejemplo, una frase podría ser "el coche rojo a la izquierda" o "la mujer que sostiene un paraguas". Cada expresión se empareja con un cuadro delimitador que encierra estrechamente el objeto referido. Las anotaciones se dividen en conjuntos de entrenamiento, validación y prueba, con el conjunto de prueba dividido además en dos subconjuntos (TestA y TestB) para evaluar la generalización a diferentes tipos de expresiones.
El proceso de anotación implicó un enfoque de dos etapas. Primero, se mostró una imagen a los anotadores y se les pidió identificar todos los objetos de interés, que luego se etiquetaron con categorías de la taxonomía de MS COCO. Segundo, se pidió a un grupo separado de anotadores describir cada objeto de una manera que permitiera a otra persona identificarlo de forma única. Este proceso aseguró que las expresiones fueran naturales y variadas, capturando la forma en que los humanos se refieren a objetos en contexto.
Definición de la Tarea
La tarea principal asociada con RefCOCO es la comprensión de expresiones referenciales, también conocida como anclaje visual. Dada una imagen y una expresión en lenguaje natural, un modelo debe generar un cuadro delimitador que localice el objeto referido. Esta tarea requiere que el modelo comprenda tanto el contenido visual como la semántica del lenguaje, incluyendo atributos, relaciones espaciales y categorías de objetos. RefCOCO también apoya una tarea relacionada de generación de expresiones referenciales, donde el modelo debe producir una descripción en lenguaje natural para un objeto dado en una imagen.
Las métricas de evaluación para la tarea de comprensión típicamente incluyen precisión en diferentes umbrales de Intersección sobre Unión (IoU), como IoU > 0.5, donde el cuadro delimitador predicho debe superponerse con el cuadro de referencia en más de la mitad. Esta métrica mide tanto la precisión de localización como la capacidad de identificar correctamente el objeto objetivo entre distractores.
Impacto y Uso
RefCOCO ha sido fundamental para avanzar la investigación en la comprensión visión-lenguaje. Se ha utilizado para entrenar y evaluar numerosos modelos, desde enfoques tempranos basados en arquitecturas de Deep learning y Neural network hasta modelos más recientes basados en Transformer (architecture). El conjunto de datos también ha generado variantes, como RefCOCO+ y RefCOCOg, que difieren en el estilo y la complejidad de las expresiones referenciales. RefCOCO+ se centra en expresiones que describen la apariencia sin ubicación, mientras que RefCOCOg contiene frases más largas y descriptivas.
El conjunto de datos se utiliza a menudo junto con otros puntos de referencia para evaluar el rendimiento de sistemas basados en Large language model que integran entradas visuales, como los desarrollados por organizaciones como OpenAI y Google DeepMind. Sirve como banco de pruebas para modelos de Generative AI que necesitan anclar el lenguaje en datos visuales, una capacidad crítica para aplicaciones como subtitulado de imágenes, respuesta a preguntas visuales e interacción humano-robot.
Desafíos y Limitaciones
A pesar de su uso generalizado, RefCOCO tiene ciertas limitaciones. Las imágenes provienen de MS COCO, que principalmente contiene escenas cotidianas con objetos comunes, limitando la diversidad de dominios. Las expresiones referenciales son relativamente cortas y pueden no capturar la complejidad completa del lenguaje natural, como referencias pragmáticas o ambiguas. Además, el conjunto de datos tiene un sesgo hacia ciertas categorías de objetos y configuraciones espaciales, lo que puede llevar a un sobreajuste en modelos entrenados con él.
Los investigadores han abordado algunos de estos problemas creando versiones extendidas o utilizando RefCOCO como un paso de preentrenamiento antes de ajustar en conjuntos de datos más desafiantes. El conjunto de datos sigue siendo un estándar para evaluar la capacidad central de anclaje visual, y su uso continuo refleja su importancia en el campo de la Artificial intelligence.
Trabajo Relacionado y Extensiones
RefCOCO ha inspirado una línea de investigación en comprensión y generación de expresiones referenciales. Se han propuesto muchos modelos que combinan características visuales con incrustaciones de lenguaje, a menudo utilizando mecanismos de atención para alinear palabras con regiones de imagen. El conjunto de datos también se ha utilizado para estudiar el papel del contexto, como la influencia de objetos distractores en la dificultad de comprensión. Extensiones como RefCOCOg proporcionan expresiones más complejas, y se han creado otros conjuntos de datos para expresiones referenciales en videos o escenas 3D, pero RefCOCO sigue siendo un recurso fundamental.
El desarrollo de RefCOCO se alinea con tendencias más amplias en Machine learning y visión por computadora, donde grandes conjuntos de datos anotados son cruciales para entrenar y evaluar modelos. Ha sido un recurso clave para la comunidad, permitiendo comparaciones reproducibles e impulsando el progreso en la comprensión multimodal.