MS COCO Captions es un conjunto de datos ampliamente utilizado en el campo del aprendizaje automático y la inteligencia artificial para la tarea de descripción de imágenes. Fue creado por investigadores de Microsoft y colaboradores académicos, basándose en las imágenes del conjunto de datos Microsoft Common Objects in Context (COCO). El conjunto de datos proporciona una gran colección de imágenes emparejadas con múltiples descripciones en lenguaje natural escritas por humanos, lo que permite el entrenamiento y la evaluación de modelos que generan descripciones textuales de contenido visual.
El propósito principal de MS COCO Captions es apoyar la investigación en la descripción de imágenes, una tarea que une la visión por computadora y el procesamiento del lenguaje natural. Cada imagen del conjunto de datos está asociada con al menos cinco descripciones escritas por humanos de forma independiente, que capturan diferentes aspectos, objetos y actividades dentro de la escena. Esta multiplicidad de descripciones está diseñada para reflejar la diversidad de la percepción y el lenguaje humanos, proporcionando un punto de referencia sólido para evaluar qué tan bien los modelos pueden generar descripciones precisas y variadas.
Composición y estadísticas del conjunto de datos
El conjunto de datos MS COCO Captions se deriva del conjunto de datos COCO, que se publicó por primera vez en 2014. El conjunto de datos COCO original contenía 328,000 imágenes, con 2.5 millones de instancias etiquetadas de objetos en 80 categorías. Para la extensión de descripciones, los organizadores recopilaron más de 1.5 millones de descripciones de anotadores humanos a través de Amazon Mechanical Turk. Las imágenes se dividen en conjuntos de entrenamiento, validación y prueba, con la división estándar que utiliza 82,783 imágenes para entrenamiento, 40,504 para validación y 40,775 para prueba. Las descripciones suelen tener entre 10 y 12 palabras de longitud, y el tamaño del vocabulario es de aproximadamente 10,000 palabras únicas después del preprocesamiento.
Proceso de creación y anotación
Para construir el conjunto de datos, el equipo de COCO empleó trabajadores de crowdsourcing en Amazon Mechanical Turk. Cada imagen se mostró a cinco anotadores diferentes, a quienes se les indicó que escribieran una sola oración describiendo la imagen de manera natural y objetiva. Se les animó a mencionar los objetos, acciones y relaciones presentes, pero no a incluir opiniones personales ni detalles no verificables. Las pautas de anotación enfatizaron el uso de oraciones completas y evitar un lenguaje excesivamente complejo o ambiguo. Este proceso resultó en un conjunto diverso de descripciones por imagen, lo que ha demostrado mejorar la robustez de los modelos entrenados con estos datos.
Papel en el desarrollo de modelos
MS COCO Captions se ha convertido en un punto de referencia estándar para la investigación en descripción de imágenes. Modelos tempranos, como aquellos basados en arquitecturas de redes neuronales con codificadores y decodificadores transformadores, se evaluaron frecuentemente en este conjunto de datos. El conjunto de datos también se utiliza junto con el servidor de evaluación de COCO, que calcula métricas como BLEU, METEOR, ROUGE y CIDEr para comparar el rendimiento de los modelos. Estas métricas miden la superposición entre las descripciones generadas y las descripciones de referencia, siendo CIDEr diseñado específicamente para tareas de descripción de imágenes. La disponibilidad de un conjunto de datos grande y de alta calidad ha acelerado el progreso en el campo, permitiendo a los investigadores desarrollar y probar modelos cada vez más sofisticados.
Extensiones y variantes
El éxito de MS COCO Captions llevó a varias extensiones y variantes. Una variante notable es el conjunto de datos COCO-CN, que proporciona descripciones en chino para un subconjunto de imágenes de COCO. Otra es el conjunto de datos Conceptual Captions, que, aunque no se deriva directamente de COCO, sigue una filosofía similar de recopilar pares de imagen y texto a gran escala de la web. Además, el conjunto de datos COCO original se ha utilizado para otras tareas como la detección de objetos y la segmentación, lo que lo convierte en un recurso versátil en la visión por computadora. Las descripciones también se han utilizado en estudios sobre IA generativa, donde los modelos generan nuevas imágenes a partir de descripciones de texto, ya que las descripciones proporcionan una fuente rica de correspondencias entre texto e imagen.
Impacto y limitaciones
MS COCO Captions ha tenido un impacto significativo en el desarrollo de sistemas de descripción de imágenes, incluidos aquellos utilizados en tecnologías de asistencia para personas con discapacidad visual y en la descripción automática de videos. Sin embargo, el conjunto de datos tiene limitaciones. Las imágenes son principalmente fotografías de consumo, que pueden no cubrir todos los dominios visuales, y las descripciones tienden a describir los objetos y acciones más destacados, posiblemente omitiendo información sutil o contextual. Además, el proceso de anotación puede introducir sesgos, ya que los anotadores eran predominantemente hablantes de inglés de un trasfondo cultural específico. A pesar de estas limitaciones, el conjunto de datos sigue siendo un recurso fundamental en el campo, y su influencia se puede ver en muchos conjuntos de datos y modelos posteriores.