Traducido del inglés

Microsoft COCO es un conjunto de datos a gran escala para la detección de objetos, la segmentación y el subtitulado, que contiene más de 330,000 imágenes con anotaciones detalladas. Sirve como punto de referencia para los modelos de visión por computadora y ha impulsado avances en el aprendizaje profundo.

Microsoft COCO (Common Objects in Context) es un conjunto de datos a gran escala para la detección de objetos, segmentación y generación de subtítulos, publicado por Microsoft en 2014. Contiene más de 330,000 imágenes, con más de 200,000 etiquetadas, que incluyen 80 categorías de objetos y 91 categorías de material de fondo. Cada imagen incluye múltiples anotaciones, como cuadros delimitadores, máscaras de segmentación y subtítulos en lenguaje natural, lo que lo convierte en un recurso integral para entrenar y evaluar modelos de visión por computadora.

El conjunto de datos se introdujo para abordar las limitaciones de conjuntos de datos anteriores como ImageNet, que se centraban principalmente en la clasificación de imágenes. COCO enfatiza la comprensión contextual al representar objetos en sus entornos naturales, con escenas complejas que contienen múltiples objetos, instancias superpuestas y relaciones espaciales variadas. Este diseño ha convertido a COCO en un estándar de referencia para tareas como la detección de objetos, la segmentación de instancias y la generación de subtítulos de imágenes, impulsando el progreso en la investigación de aprendizaje profundo y aprendizaje automático.

Estructura del conjunto de datos y anotaciones

COCO proporciona máscaras de segmentación a nivel de píxel para instancias de objetos, lo que permite una evaluación precisa de los algoritmos de segmentación. Las 80 categorías de objetos incluyen elementos comunes como persona, automóvil y perro, mientras que las 91 categorías de material de fondo cubren elementos de fondo como césped, cielo y carretera. Las anotaciones se almacenan en formato JSON, con cada imagen vinculada a un conjunto de archivos de anotación. El conjunto de datos se divide en conjuntos de entrenamiento (118,000 imágenes), validación (5,000) y prueba (20,000), con el conjunto de prueba teniendo etiquetas ocultas para la evaluación de desafíos.

Además de la detección y la segmentación, COCO incluye cinco subtítulos en lenguaje natural por imagen, generados por anotadores humanos, lo que facilita la investigación en generación de subtítulos de imágenes y tareas de visión y lenguaje. El conjunto de datos también proporciona anotaciones de puntos clave para la estimación de pose humana, con 17 puntos clave por persona, y segmentación de material de fondo para la comprensión de escenas.

Impacto en la investigación de visión por computadora

COCO se ha convertido en un estándar de facto para evaluar modelos de detección de objetos y segmentación. El Desafío COCO, celebrado anualmente desde 2015, ha fomentado la competencia entre los principales grupos de investigación, incluidos los de BAIR (Berkeley AI Research) y Stanford AI Lab. Muchas arquitecturas de última generación, como red residual y U-Net, han sido evaluadas en COCO, lo que ha llevado a mejoras significativas en precisión y eficiencia. La complejidad del conjunto de datos también ha fomentado el desarrollo de técnicas de aumento de datos y métodos de normalización por lotes para manejar escenas diversas.

Además, la tarea de generación de subtítulos de COCO ha avanzado en IA generativa y modelos basados en transformadores, ya que los investigadores utilizan el conjunto de datos para entrenar modelos que generan texto descriptivo a partir de imágenes. Esto ha influido en el diseño de modelos de lenguaje grandes que integran visión y lenguaje, como los desarrollados por OpenAI y Google DeepMind.

Métricas de referencia y evaluación

COCO define métricas estándar para detección y segmentación, incluida la Precisión Promedio (AP) en múltiples umbrales de Intersección sobre Unión (IoU), que van desde 0.5 hasta 0.95. La métrica principal, AP@[0.5:0.95], promedia la AP en todos los umbrales de IoU, proporcionando una medida integral de la precisión de localización. Para la segmentación, se aplican las mismas métricas a las predicciones de máscaras. Para la generación de subtítulos, se utilizan métricas como BLEU, METEOR y CIDEr para evaluar la calidad de los subtítulos generados en comparación con las referencias humanas.

El conjunto de datos también incluye un conjunto de desarrollo de prueba para envíos de desafíos, con resultados publicados en el servidor de evaluación oficial. Esto ha permitido una comparación justa entre modelos, impulsando un progreso rápido en el campo.

Extensiones y variantes

Se han publicado varias extensiones de COCO para abordar necesidades de investigación específicas. COCO-Stuff agrega anotaciones a nivel de píxel para clases de material de fondo, mientras que COCO-Text se centra en la detección y reconocimiento de texto en escenas naturales. La segmentación panóptica combina clases de material de fondo y cosas en una tarea unificada, con COCO proporcionando las anotaciones necesarias. Estas variantes han ampliado la aplicabilidad del conjunto de datos, apoyando la investigación en inteligencia artificial y visión por computadora más allá de la detección de objetos tradicional.

Limitaciones y críticas

A pesar de su uso generalizado, COCO tiene limitaciones. El conjunto de datos está sesgado hacia objetos y escenas comunes, con una representación limitada de categorías raras o contextos inusuales. Se han observado ruido e inconsistencias en las anotaciones, particularmente en las máscaras de segmentación. Además, el tamaño y la complejidad del conjunto de datos requieren recursos computacionales significativos para el entrenamiento, lo que puede dificultar el acceso para grupos de investigación más pequeños. Algunos investigadores también han planteado preocupaciones sobre las implicaciones éticas de usar conjuntos de datos con posibles problemas de privacidad, ya que las imágenes pueden contener individuos identificables.

Conclusión

Microsoft COCO ha desempeñado un papel fundamental en el avance de la visión por computadora al proporcionar un conjunto de datos rico y anotado que desafía a los modelos a comprender objetos en contexto. Sus puntos de referencia se han convertido en estándares en el campo, influyendo tanto en la investigación académica como en las aplicaciones industriales. A medida que el aprendizaje profundo continúa evolucionando, COCO sigue siendo un recurso fundamental, aunque los futuros conjuntos de datos pueden abordar sus limitaciones para apoyar sistemas de IA más robustos e imparciales.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·benchmark
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial