COCO Captions 2015

Traducido del inglés

COCO Captions 2015 es un conjunto de datos que contiene cinco descripciones escritas por humanos para cada imagen de la colección COCO 2014/2015, utilizado para entrenar y evaluar modelos de descripción de imágenes en visión por computadora y procesamiento del lenguaje natural.

COCO Captions 2015 es un conjunto de datos de referencia ampliamente utilizado para la descripción de imágenes, que consiste en cinco descripciones escritas por humanos e independientes para cada imagen de las colecciones Microsoft COCO (Common Objects in Context) de 2014 y 2015. El conjunto de datos se introdujo para apoyar la investigación en inteligencia artificial y aprendizaje automático, específicamente en tareas que requieren generar descripciones en lenguaje natural del contenido visual. Cada descripción es una oración completa que describe los objetos, acciones y relaciones presentes en la imagen correspondiente, proporcionando una fuente rica de datos alineados de visión y lenguaje.

Las descripciones se recopilaron mediante Amazon Mechanical Turk, con trabajadores instruidos para describir todas las partes importantes de la imagen en una sola oración. El conjunto de datos incluye más de 330,000 imágenes, cada una emparejada con cinco descripciones, lo que produce más de 1.5 millones de pares de descripción e imagen. COCO Captions 2015 se convirtió en un conjunto de evaluación estándar para modelos que combinan técnicas de aprendizaje profundo en visión por computadora y procesamiento del lenguaje natural, a menudo utilizando arquitecturas de red neuronal como modelos codificador-decodificador. El diseño del conjunto de datos fomenta la diversidad en la redacción, ya que diferentes anotadores describen la misma escena de maneras variadas, lo que pone a prueba la capacidad de un modelo para producir texto fluido y semánticamente preciso.

Estructura y Estadísticas

El conjunto de datos COCO Captions 2015 se organiza en divisiones de entrenamiento, validación y prueba, con la división de prueba subdividida en un conjunto de prueba público y un conjunto de prueba reservado utilizado para la evaluación oficial. La división de entrenamiento contiene aproximadamente 82,783 imágenes, la división de validación contiene 40,504 imágenes y la división de prueba contiene 40,775 imágenes. Cada imagen se asocia con cinco descripciones, pero las descripciones del conjunto de prueba no se publican públicamente para prevenir el sobreajuste; en su lugar, los investigadores envían predicciones a un servidor de evaluación. Las descripciones varían en longitud, típicamente entre 8 y 25 palabras, y cubren una amplia gama de escenas cotidianas, incluyendo personas, animales, vehículos y entornos interiores y exteriores.

Métricas de Evaluación

Las métricas de evaluación estándar para COCO Captions 2015 incluyen BLEU, METEOR, ROUGE-L y CIDEr. CIDEr (Evaluación de Descripción de Imágenes Basada en Consenso) fue diseñada específicamente para la descripción de imágenes y mide el consenso entre una descripción generada y el conjunto de referencias humanas utilizando superposiciones de n-gramas ponderadas por TF-IDF. El script de evaluación oficial del conjunto de datos calcula estas métricas en el conjunto de prueba reservado, y las tablas de clasificación rastrean el rendimiento de los modelos de última generación. En 2015, los sistemas de mejor rendimiento alcanzaron puntuaciones BLEU-4 de alrededor de 0.30 y puntuaciones CIDEr de alrededor de 1.0, pero los avances posteriores en arquitecturas basadas en transformador y el preentrenamiento de modelos de lenguaje grandes han mejorado significativamente estos números.

Papel en el Desarrollo de Modelos

COCO Captions 2015 ha sido fundamental en el desarrollo de sistemas modernos de descripción de imágenes. Los primeros enfoques utilizaban backbones de red residual o U-Net para la extracción de características visuales, combinados con redes neuronales recurrentes para la generación de texto. Más tarde, los mecanismos de atención multicabeza y atención cruzada, introducidos en la arquitectura transformador, reemplazaron los componentes recurrentes, permitiendo un entrenamiento paralelo más eficiente. El conjunto de datos también facilitó la investigación en aumento de datos y aprendizaje curricular, así como el uso de estrategias de decodificación como búsqueda de haz y muestreo top-p. Muchos modelos de IA generativa, incluidos los de OpenAI y Google DeepMind, han utilizado COCO Captions 2015 como punto de referencia de preentrenamiento o evaluación, aunque han surgido conjuntos de datos más nuevos como Flickr30k y Visual Genome.

Limitaciones y Legado

El conjunto de datos tiene limitaciones conocidas, incluido un sesgo hacia objetos comunes y estructuras de oraciones simples, así como un posible ruido de anotación por parte de los trabajadores de crowdsourcing. También carece de relaciones espaciales detalladas y desafíos de razonamiento compositivo que aparecen en puntos de referencia más recientes. A pesar de estos problemas, COCO Captions 2015 sigue siendo un recurso fundamental para comparar métodos de descripción de imágenes y para estudiar la alineación entre visión y lenguaje. Su diseño de cinco descripciones por imagen ha influido en conjuntos de datos posteriores, y su protocolo de evaluación continúa utilizándose en la investigación académica. El conjunto de datos está disponible gratuitamente para uso académico, y sus anotaciones son ampliamente citadas en la literatura.

Puntos de Referencia Relacionados y Extensiones

Las extensiones de COCO Captions 2015 incluyen COCO-CN, que añade descripciones en chino, y nocaps, que se centra en la descripción de objetos novedosos. El conjunto de datos también se superpone con las tareas de detección y segmentación de COCO, lo que permite el aprendizaje multitarea. Los investigadores a menudo combinan COCO Captions 2015 con otros conjuntos de datos para mejorar la generalización, y sigue siendo una opción común para probar modelos secuencia a secuencia en tareas de visión y lenguaje. La influencia del conjunto de datos se extiende a ofertas de Amazon Web Services y Google Cloud, que proporcionan versiones preprocesadas para el entrenamiento de modelos en la nube.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·image-captioning·computer-vision·natural-language-processing
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial