COCO 2017 es la edición anual del desafío Common Objects in Context (COCO), un punto de referencia a gran escala para la detección de objetos, la segmentación y el subtitulado de imágenes. Publicado en 2017 por el equipo de investigación de Microsoft, se convirtió en el conjunto de datos de evaluación estándar para modelos de visión por computadora, sucediendo a versiones anteriores de 2014 y 2015. El conjunto de datos contiene 118,000 imágenes de entrenamiento, 5,000 imágenes de validación y 41,000 imágenes de prueba, con anotaciones que cubren 80 categorías de objetos y 91 categorías de materiales de fondo.
Las tareas del desafío incluyen detección de objetos con cajas delimitadoras, segmentación de instancias, segmentación panóptica (añadida posteriormente) y subtitulado de imágenes. COCO 2017 introdujo una nueva división test-dev y protocolos de anotación refinados, haciéndolo más riguroso que ediciones anteriores. Se utiliza ampliamente en investigación académica y competiciones industriales, con tablas de clasificación que rastrean el rendimiento de última generación.
Composición del Conjunto de Datos
El conjunto de datos COCO 2017 comprende más de 200,000 imágenes con más de 1.5 millones de instancias etiquetadas. Cada imagen está anotada con cajas delimitadoras de objetos, máscaras de segmentación y subtítulos. Las 80 categorías de objetos incluyen elementos comunes como persona, coche, perro y silla, mientras que las 91 categorías de materiales de fondo cubren fondos como césped, cielo y pared. Las imágenes provienen de Flickr y son diversas en composición de escena, iluminación y escala de objetos.
Las anotaciones se proporcionan en formato JSON, con cada imagen teniendo múltiples entradas de anotación. El conjunto de entrenamiento se utiliza para el entrenamiento de modelos, mientras que el conjunto de validación es para el ajuste de hiperparámetros y la selección de modelos. El conjunto de prueba se utiliza para la evaluación final, con anotaciones ocultas al acceso público para prevenir el sobreajuste.
Métricas de Evaluación
COCO 2017 utiliza las métricas de evaluación estándar de COCO, principalmente Precisión Promedio (AP) y Recuerdo Promedio (AR). La AP se calcula en múltiples umbrales de Intersección sobre Unión (IoU), desde 0.5 hasta 0.95 en pasos de 0.05, y se promedia. Esta métrica es más estricta que la métrica tradicional de PASCAL VOC, que utiliza un IoU fijo de 0.5. La métrica principal es AP@[0.5:0.95], a menudo denotada simplemente como AP.
Para tareas de segmentación, se aplican las mismas métricas a las predicciones de máscaras. Para subtitulado, se utilizan métricas como BLEU, METEOR y CIDEr. El desafío también rastrea la velocidad de inferencia, con una categoría de latencia separada en algunos años.
Impacto en la Visión por Computadora
COCO 2017 se convirtió en el punto de referencia de facto para la investigación en detección de objetos y segmentación. Muchos modelos influyentes fueron evaluados en él, incluidos detectores basados en ResNet, variantes de U-Net y arquitecturas basadas en transformadores posteriores. El conjunto de datos impulsó el progreso en el aprendizaje de características multiescala, detección sin anclas y segmentación de instancias.
Su gran escala y anotaciones diversas permitieron el desarrollo de técnicas de aumento de datos y métodos de normalización por lotes. El desafío también estimuló la investigación en aprendizaje débilmente supervisado y aprendizaje semisupervisado, ya que las anotaciones del conjunto de prueba están ocultas.
Ediciones del Desafío y Ganadores
COCO 2017 fue parte de una serie de desafíos anuales. La edición de 2017 contó con la participación de grandes empresas tecnológicas e instituciones académicas. Los equipos ganadores a menudo utilizaban modelos de conjunto y estrategias de entrenamiento avanzadas. Por ejemplo, el ganador de detección en 2017 logró una AP de 0.493, una mejora significativa sobre los 0.375 del ganador de 2015.
El formato del desafío incluía pistas separadas para detección, segmentación y subtitulado. La pista de segmentación se centraba en máscaras a nivel de instancia, mientras que la pista de subtitulado requería generar descripciones en lenguaje natural. La edición de 2017 también introdujo una nueva tarea de segmentación de materiales de fondo, que luego evolucionó hacia la segmentación panóptica en 2018.
Legado y Futuro
COCO 2017 sigue siendo ampliamente utilizado incluso después de la introducción de conjuntos de datos más nuevos como LVIS y Open Images. Sus anotaciones siguen siendo el estándar para evaluar muchos modelos de aprendizaje profundo. El conjunto de datos se ha incorporado en herramientas populares como Detectron2 y MMDetection, haciéndolo accesible para investigadores de todo el mundo.
A partir de 2025, COCO 2017 continúa siendo un punto de referencia para el rendimiento de modelos, aunque puntos de referencia más nuevos como Open Images de Google Cloud y los conjuntos de datos públicos de AWS ofrecen desafíos alternativos. El consorcio COCO ha publicado ediciones posteriores, pero 2017 sigue siendo la versión más citada y utilizada en la literatura.