Traducido del inglés

MS COCO Captions es un conjunto de datos a gran escala de oraciones escritas por humanos que describen imágenes del corpus Microsoft COCO, con cinco descripciones por imagen. Sirve como un punto de referencia estándar para entrenar y evaluar modelos de generación de descripciones de imágenes.

MS COCO Captions es un conjunto de datos a gran escala de frases escritas por humanos que describen imágenes de la colección Microsoft Common Objects in Context (COCO). Proporciona cinco descripciones independientes para cada una de más de 330 000 imágenes, lo que lo convierte en un punto de referencia estándar para la investigación en inteligencia artificial sobre la comprensión visión-lenguaje.

El conjunto de datos se creó para respaldar la tarea de descripción de imágenes, en la que un modelo debe generar una descripción en lenguaje natural de una imagen. Su escala, diversidad y calidad de anotación lo han convertido en un recurso fundamental en aprendizaje automático y aprendizaje profundo.

Historia y creación

El conjunto de datos Microsoft COCO se publicó por primera vez en 2014 como parte de un esfuerzo por avanzar en el reconocimiento de objetos y la comprensión de escenas. Las anotaciones de descripciones se recopilaron mediante Amazon Mechanical Turk, donde se pedía a los trabajadores que describieran los objetos, acciones y relaciones importantes en cada imagen. En 2015, un artículo complementario de Xinlei Chen y colegas detalló la metodología de recopilación e introdujo un servidor de evaluación. El conjunto de datos final contiene 328 000 imágenes, cada una con cinco descripciones, que suman alrededor de 1,5 millones de frases.

Estadísticas y estructura del conjunto de datos

Cada descripción es una frase en inglés, normalmente de 10 a 12 palabras de longitud, y el vocabulario completo abarca aproximadamente 10 000 palabras. Las imágenes cubren 80 categorías de objetos e incluyen escenas complejas con múltiples objetos que interactúan. El conjunto de datos se divide en conjuntos de entrenamiento, validación y prueba, y las descripciones de prueba se retienen para la evaluación. La división original de 2014 incluye 82 783 imágenes de entrenamiento, 40 504 imágenes de validación y 40 775 imágenes de prueba. Esta estructura respalda la evaluación reproducible de modelos de redes neuronales.

Evaluación y puntos de referencia

MS COCO Captions es el punto de referencia principal para la tarea de descripción de imágenes. Métricas automáticas como BLEU, METEOR, ROUGE, CIDEr y SPICE se utilizan para comparar las salidas del modelo con las cinco descripciones de referencia. El servidor de evaluación, alojado por el proyecto COCO, permite a los investigadores enviar resultados para el conjunto de prueba retenido. Los primeros sistemas de última generación utilizaban arquitecturas codificador-decodificador con aprendizaje secuencia a secuencia. Los avances posteriores incorporaron modelos transformador y mecanismos de atención multicabezal, a menudo inicializados a partir de modelos de lenguaje grandes. Estos modelos emplean con frecuencia capas de atención cruzada para alinear características visuales con texto, y la decodificación suele depender de la búsqueda de haz para generar descripciones fluidas.

Impacto y aplicaciones

El conjunto de datos ha impulsado el progreso en IA generativa para tareas de visión-lenguaje. Se utiliza para entrenar modelos para la generación automática de texto alternativo, la recuperación de imágenes y la respuesta a preguntas visuales. Las anotaciones también se han adaptado para la aumentación de datos en otras tareas de visión por computadora, como la detección de objetos y la segmentación. Los investigadores han utilizado MS COCO Captions para estudiar la generalización composicional, la alineación entre modalidades y la robustez de los sistemas de aprendizaje profundo.

Limitaciones y extensiones

A pesar de su éxito, MS COCO Captions tiene limitaciones conocidas. Las imágenes representan predominantemente escenas cotidianas de contextos occidentales, y las descripciones pueden reflejar sesgos culturales. El vocabulario es relativamente pequeño y las frases son más cortas que las descripciones humanas típicas. Para abordar estos problemas, los investigadores han creado extensiones como COCO-CN para descripciones en chino y el conjunto de datos nocaps para la descripción de vocabulario abierto. Estos esfuerzos continúan influyendo en el diseño de nuevos puntos de referencia en inteligencia artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·image-captioning·computer-vision·natural-language-processing
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial