COCO 2014 (Common Objects in Context) é a primeira versão pública do conjunto de dados Microsoft COCO, uma coleção de imagens em grande escala projetada para avançar na detección de objetos, segmentação e legendagem de imagens. Presentado pela primeira vez em um artigo de 2014 por Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár e C. Lawrence Zitnick, o conjunto de dados comprende 328.000 imagens contendo mais de 2,5 milhões de instancias rotuladas em 80 categorias de objetos. Sua característica definitoria é a ênfase em cenas cotidianas com objetos em suas relações espaciais naturais, contrastando com conjuntos de dados anteriores como ImageNet, que frequentemente apresentavam sujeitos centrados e isolados.
A versión de 2014 estabeleceu as divisões padrão de treinamento/validação (val) que se tornaron uma convenção de referência. O conjunto de treinamento contém 82.783 imagens, enquanto o conjunto de validação possui 40.504 imagens; um conjunto de teste separado de 40.775 imagens foi usado para avaliação, mas seus rótulos foram retenidos por um tempo para evitar sobreajuste. As anotaciones incluyen polígonos de segmentação por instancia (não apenas caixas delimitadoras), cinco legendas em linguagem natural por imagem e, para um subconjunto, anotaciones de puntos clave para estimación de pose humana - especificamente, 17 articulaciones corporales en 5.000 imágenes de entrenamiento y 2.000 de validación. El conjunto de datos también incluye categorías de escena a nivel de imagen y categorías de "material" (por ejemplo, cielo, césped) para contexto, aunque estas fueron desarrolladas más completamente en versiones posteriores.
Formato de Anotación y Desafíos
COCO 2014 introdujo un formato de anotación basado en JSON que se convirtió en un estándar de la industria. Cada imagen está asociada con segmentos, que se almacenan como matrices de coordenadas de polígonos; las instancias también pueden tener cajas delimitadoras derivadas de puntos extremos. Para reflejar la dificultad del mundo real, el conjunto de datos incluye deliberadamente objetos pequeños, ocluidos y truncados, con una bandera de "difícil" en algunas instancias que muchos desafíos de detección ignoraron. Las métricas de evaluación oficiales - Precisión Promedio (AP) en múltiples umbrales de Intersección sobre Unión (IoU), que van de 0,5 a 0,95 en pasos de 0,05 - incentivaron métodos para producir máscaras y cajas precisas, empujando el campo más allá de la localización gruesa simple.
Impacto en la Investigación de Visión por Computadora
La versión COCO 2014 catalizó una serie de desafíos, comenzando con el Desafío de Detección COCO en 2015, que se ejecutó junto a conferencias importantes como ICCV y CVPR. Los sistemas ganadores progresaron rápidamente desde características artesanales clásicas hasta los primeros modelos de aprendizaje profundo basados en redes neuronales convolucionales. La escala y el detalle de anotación del conjunto de datos permitieron a los investigadores entrenar redes residuales y otras arquitecturas para segmentación y estimación de pose, convirtiéndolo en un recurso fundamental para tareas posteriores como la segmentación panóptica. Sus leyendas también fomentaron el desarrollo de modelos secuencia a secuencia para la leyenda de imágenes, contribuyendo directamente al auge del aprendizaje multimodal.
Papel en el Desarrollo Moderno de la IA
A partir de la década de 2020, COCO 2014 sigue siendo uno de los conjuntos de datos más citados en inteligencia artificial. Sirve como banco de pruebas común para evaluar redes neuronales en detección de objetos, con marcos como Detectron2 y YOLO informando rutinariamente sobre sus métricas. Las divisiones de 2014 son especialmente valiosas para la reproducibilidad: a diferencia de la iteración COCO 2017 posterior, que alteró los tamaños de las divisiones de entrenamiento/validación y pasó a 118k/5k imágenes, la composición exacta de la versión 2014 ha sido ampliamente archivada y estudiada. Muchos profesionales de aprendizaje automático aún descargan el original porque los modelos preentrenados y los códigos base a menudo esperan el diseño de directorio y los IDs de anotación de 2014.
Distinciones de Versiones Posteriores
COCO 2014 se distingue de la versión 2017 en varios aspectos técnicos. El conjunto de entrenamiento de 2014 incluye 82.783 imágenes, mientras que el de 2017 tiene 118.287, y el conjunto de validación de 2014 (40.504) es mucho más grande que el de 2017 (5.000). Los conjuntos de prueba de 2017 también fueron más grandes. Además, la versión 2014 no tenía un subconjunto 'no etiquetado' oficial; 2017 agregó 123.000 imágenes no etiquetadas para aprendizaje semisupervisado. Las anotaciones de puntos clave en 2014 solo están disponibles para unas pocas miles de imágenes, mientras que 2017 se expandió para cubrir todas las imágenes de entrenamiento y validación. Estas diferencias significan que usar datos de 2014 requiere cuidado al comparar resultados con puntos de referencia contemporáneos, aunque muchos artículos clásicos informaron sobre la división de 2014, manteniéndola relevante para el análisis histórico.
Legado y Uso Continuado
El éxito de COCO 2014 demostró el valor de conjuntos de datos ricamente anotados y con mucho contexto, influyendo en esfuerzos posteriores como LVIS y Open Images. Su esquema de anotación persiste en herramientas modernas como la API COCO, que sigue siendo el estándar para analizar máscaras de polígonos y para evaluar segmentación de instancias. Incluso cuando surgen conjuntos de datos más nuevos, la combinación de escala, profundidad de anotación y estabilidad de división pública de COCO 2014 asegura su papel como un "estándar teórico" para el desarrollo de algoritmos. Mientras el campo se ha desplazado hacia conjuntos de datos multimodales más grandes, COCO 2014 aún sustenta innumerables tesis doctorales y evaluaciones de modelos industriales, atestiguando su utilidad duradera en la investigación de visión.
Véase También
- Aumento de datos - Técnicas a menudo utilizadas al entrenar con imágenes COCO
- Funciones de pérdida - Tipos de funciones utilizadas en pérdidas de detección y segmentación
- AWS - Plataformas de nube comúnmente utilizadas para alojar y procesar COCO
- Laboratorio de IA de Stanford - Un grupo de investigación que ha contribuido a evaluaciones basadas en COCO