Traducido del inglés

COCO 2014 es la versión original del conjunto de datos Microsoft Common Objects in Context, que contiene 328k imágenes con máscaras de segmentación, subtítulos y anotaciones de puntos clave, ampliamente utilizado para evaluar modelos de detección de objetos y segmentación.

COCO 2014 (Common Objects in Context) es la primera publicación pública del conjunto de datos Microsoft COCO, una colección de imágenes a gran escala diseñada para avanzar en la detección de objetos, la segmentación y el subtitulado de imágenes. Presentado por primera vez en un artículo de 2014 por Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár y C. Lawrence Zitnick, el conjunto de datos comprende 328,000 imágenes que contienen más de 2.5 millones de instancias etiquetadas en 80 categorías de objetos. Su rasgo definitorio es el énfasis en escenas cotidianas con objetos en sus relaciones espaciales naturales, en contraste con conjuntos de datos anteriores como ImageNet, que a menudo presentaban sujetos centrados y aislados.

La publicación de 2014 estableció las divisiones estándar de entrenamiento/validación (val) que se han convertido en una convención de referencia. El conjunto de entrenamiento contiene 82,783 imágenes, mientras que el conjunto de validación contiene 40,504 imágenes; un conjunto de prueba separado de 40,775 imágenes se utilizó para la evaluación, pero sus etiquetas se retuvieron durante un tiempo para prevenir el sobreajuste. Las anotaciones incluyen polígonos de segmentación por instancia (no solo cajas delimitadoras), cinco subtítulos en lenguaje natural por imagen y, para un subconjunto, anotaciones de puntos clave para la estimación de pose humana - específicamente, 17 articulaciones del cuerpo en 5,000 imágenes de entrenamiento y 2,000 de validación. El conjunto de datos también incluye categorías de escena a nivel de imagen y categorías de "cosas" (por ejemplo, cielo, hierba) para contexto, aunque estas se desarrollaron más completamente en publicaciones posteriores.

Formato de Anotación y Desafíos

COCO 2014 introdujo un formato de anotación basado en JSON que se convirtió en un estándar de la industria. Cada imagen se asocia con segmentos, que se almacenan como matrices de coordenadas de polígonos; las instancias también pueden tener cajas delimitadoras derivadas de puntos extremos. Para reflejar la dificultad del mundo real, el conjunto de datos incluye deliberadamente objetos pequeños, ocluidos y truncados, con una marca de "difícil" en algunas instancias que muchos desafíos de detección ignoraron. Las métricas de evaluación oficiales - Precisión Promedio (AP) en múltiples umbrales de Intersección sobre Unión (IoU), que van de 0.5 a 0.95 en pasos de 0.05 - incentivaron métodos para producir máscaras y cajas precisas, empujando el campo más allá de la localización gruesa simple.

Impacto en la Investigación de Visión por Computadora

La publicación de COCO 2014 catalizó una serie de desafíos, comenzando con el Desafío de Detección COCO en 2015, que se llevó a cabo junto a conferencias importantes como ICCV y CVPR. Los sistemas ganadores progresaron rápidamente desde características artesanales clásicas hasta los primeros modelos de aprendizaje profundo basados en redes neuronales convolucionales. La escala del conjunto de datos y el detalle de las anotaciones permitieron a los investigadores entrenar redes residuales y otras arquitecturas para segmentación y estimación de pose, convirtiéndolo en un recurso fundamental para tareas posteriores como la segmentación panóptica. Sus subtítulos también fomentaron el desarrollo de modelos secuencia a secuencia para el subtitulado de imágenes, contribuyendo directamente al auge del aprendizaje multimodal.

Papel en el Desarrollo Moderno de la IA

A partir de la década de 2020, COCO 2014 sigue siendo uno de los conjuntos de datos más citados en inteligencia artificial. Sirve como un banco de pruebas común para evaluar redes neuronales en detección de objetos, con marcos como Detectron2 y YOLO informando rutinariamente sobre sus métricas. Las divisiones de 2014 son especialmente valiosas para la reproducibilidad: a diferencia de la iteración posterior COCO 2017, que alteró los tamaños de las divisiones de entrenamiento/validación y pasó a 118k/5k imágenes, la composición exacta de la versión de 2014 ha sido ampliamente archivada y estudiada. Muchos profesionales de aprendizaje automático aún descargan el original porque los modelos preentrenados y los códigos base a menudo esperan el diseño de directorio y los IDs de anotación de 2014.

Distinciones de Publicaciones Posteriores

COCO 2014 se distingue de la versión de 2017 en varios aspectos técnicos. El conjunto de entrenamiento de 2014 incluye 82,783 imágenes, mientras que el de 2017 tiene 118,287, y el conjunto de validación de 2014 (40,504) es mucho más grande que el de 2017 (5,000). Los conjuntos de prueba de 2017 también fueron más grandes. Además, la publicación de 2014 no tenía un subconjunto oficial 'no etiquetado'; 2017 añadió 123,000 imágenes no etiquetadas para aprendizaje semisupervisado. Las anotaciones de puntos clave en 2014 solo están disponibles para unos pocos miles de imágenes, mientras que 2017 se expandió para cubrir todas las imágenes de entrenamiento y validación. Estas diferencias significan que usar datos de 2014 requiere cuidado al comparar resultados con puntos de referencia contemporáneos, aunque muchos artículos clásicos informaron sobre la división de 2014, manteniéndola relevante para el análisis histórico.

Legado y Uso Continuado

El éxito de COCO 2014 demostró el valor de los conjuntos de datos ricamente anotados y centrados en el contexto, influyendo en esfuerzos posteriores como LVIS y Open Images. Su esquema de anotación persiste en herramientas modernas como la API COCO, que sigue siendo el estándar para analizar máscaras de polígonos y evaluar la segmentación de instancias. Incluso cuando surgen conjuntos de datos más nuevos, la combinación de escala, profundidad de anotación y estabilidad de división pública de COCO 2014 asegura su papel como un "estándar teórico" para el desarrollo de algoritmos. Aunque el campo se ha desplazado hacia conjuntos de datos multimodales más grandes, COCO 2014 sigue sustentando innumerables tesis doctorales y evaluaciones de modelos industriales, atestiguando su utilidad perdurable en la investigación de visión.

Véase También

  • aumento de datos - Técnicas a menudo utilizadas al entrenar con imágenes COCO
  • funciones de pérdida - Tipos de funciones utilizadas en pérdidas de detección y segmentación
  • AWS - Plataformas en la nube comúnmente utilizadas para alojar y procesar COCO
  • Laboratorio de IA de Stanford - Un grupo de investigación que ha contribuido a evaluaciones basadas en COCO
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·object-detection·segmentation
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial