RefCOCOg es un conjunto de datos de referencia en visión por computadora y procesamiento del lenguaje natural, diseñado para la tarea de comprensión y generación de expresiones referenciales. Fue introducido para abordar limitaciones en conjuntos de datos de expresiones referentes anteriores, en particular la necesidad de un lenguaje más largo, descriptivo y dependiente del contexto. El conjunto de datos proporciona un campo de prueba desafiante para modelos que deben alinear información visual con descripciones lingüísticas, una capacidad central para aplicaciones como la interacción humano-robot, la edición de imágenes y la respuesta a preguntas visuales.
El conjunto de datos contiene 104,560 expresiones referentes para 54,822 objetos en 26,711 imágenes, todas extraídas del conjunto de datos Microsoft COCO (Common Objects in Context). Una característica clave de RefCOCOg es que sus expresiones son más largas y naturales que las de predecesores como RefCOCO, a menudo requiriendo una comprensión de las relaciones entre múltiples objetos en una escena. Por ejemplo, una expresión podría ser "el hombre de camisa azul de pie junto al coche rojo", lo cual requiere ubicar tanto el objeto principal como su contexto relacional.
Construcción y Anotación
RefCOCOg fue creado por un equipo de investigadores, y el proceso de anotación involucró a anotadores humanos a quienes se les pidió escribir descripciones que identificaran de manera única un objeto dentro de una imagen. Las anotaciones se recopilaron a través de una plataforma de <tiendas> y cada expresión se validó para garantizar que fuera sin ambigüedades. El conjunto de datos se divide en subconjuntos de entrenamiento, validación y prueba, con el subconjunto de prueba dividido en dos partes según si los anotadores vieron la imagen durante el entrenamiento (conocidos como 'refexp' y 'refexp+'). Este diseño de división ayuda a evaluar la generalización a anotadores y estilos de lenguaje no vistos.
Formulación de Tareas
La tarea principal asociada con RefCOCOg es la comprensión de expresiones referentes, donde un modelo recibe una tareaespecífica y una descripción textual y debe localizar el objeto descrito, típicamente prediciendo una caja incluyente o una máscara de {segmentación}. Una tarea relacionada es la generación de expresiones referentes, donde el modelo debe producir una descripción en lenguaje natural para un objeto en una imagen. Ambas tareas se mide con métricas estándar como la intersección y superposición (IoU) para la comprensión y con métricas como CIDEr o BLEU para la generación.
impact en el Desarrollo de Modelos
RefCOCOg ha sido ampliamente utilizado para entrenar y evaluar modelos de aprendizaje profundo, especialmente los basados en Transformer (architecture) y mecanismos de Multi-Head Attention. Los primeros enfoques utilizaban redes de base como Residual Network (ResNet) para la extracción de características visuales, combinadas con redes neuronales recurrentes para la codificación del lenguaje. Los sistemas más recientes aprovechan Large language model y Vision-language model, comúnmente integrando capas de Cross-Attention para fusionar modalidades visuales y textuales. El énfasis del conjunto de datos en expresiones más largas impulsó desarrollo de modelos que razonan sobre relaciones espaciales, atributos y contexto, más allá de la detección de objetos simple.
Relación con otros conjuntos de datos
LosrefCOCOg es parte de la familia de conjuntos de datos de referencias y sostenidos, incluidos los datos enunciados refcoco, refcoco+ y refcocog, presentados alrededor de la misma época. Mientras que RefCOCO se centra en expresiones más cortas y más detalladas, RefCOCO+ restringe a descripciones basadas en la apariencia de los objetos, evitando palabras de ubicación. RefCOCOg se distingue por sus descripciones más largas y más conversacionales que a menudo requieren una comprensión completa de la escena. Juntos, estos conjuntos de datos se han convertido en pruebas de referencia en el campo, con clasificaciones que tienen en cuenta el estado de la[a] avanzada en cada conjunto.
Desafíos y Limitaciones
A pesar de su utilidad, losrefCOCOg tiene limitaciones conocidas. El conjunto se deriva de MS COCO, que presenta una bias hacia categorías de objetos comunes y escenas cotidianas, lo que limita la diversidad. Aunque las expresiones son más largas, no pueden capturar la complejidad completa de la referencia humana en interacciones del mundo real, como usar gestos o conocimiento compartido. Además, la evaluación basada en cajas limitantes puede ser imprecisa, y algunas expresiones pueden ser ambiguas incluso para humanos. Investigadores han propuesto extensiones y conjuntos de datos alternativos para abordar estas brechas, pero losrefCOCOg sigue siendo un recurso fundamental para estudiar la comprensión del lenguaje anclado.
Véase también
- Artificial intelligence
- Machine learning
- Deep learning
- Neural network
- Computer vision
- Stanford AI Lab
- BAIR (Berkeley AI Research)
##Referencias
El conjunto de datos se presentó en el artículo "Grounded Language Understanding: Referring Expression Comprehension and Generation" de Junhua Mao, Jonathan Huang, AlexanderToshev, Oana Camburu, Alan Yuille y Kevin Murphy, presentado en la 2016 European Conference on Computer Vision (ECCV).