Traducido del inglés

COCO (Common Objects in Context) es un conjunto de datos de imágenes a gran escala para la detección de objetos, la segmentación y el subtitulado de imágenes, que contiene más de 330 000 imágenes con 2,5 millones de instancias etiquetadas en 80 categorías de objetos, ampliamente utilizado como referencia en visión por computadora.

COCO (Common Objects in Context) es un conjunto de datos a gran escala para tareas de visión por computador, principalmente detección de objetos, segmentación y generación de descripciones de imágenes. Creado por investigadores de Microsoft en 2014, fue diseñado para abordar las limitaciones de conjuntos de datos anteriores al centrarse en objetos en su contexto natural, con imágenes no icónicas que incluyen múltiples objetos y escenas complejas. El conjunto de datos comprende más de 330,000 imágenes, de las cuales más de 200,000 están etiquetadas, con 2.5 millones de instancias etiquetadas en 80 categorías de objetos. COCO se ha convertido en un estándar de referencia para evaluar modelos de Machine learning en tareas de visión, facilitando el progreso en arquitecturas de Deep learning y el diseño de Neural network.

A diferencia de sus predecesores que presentaban objetos únicos centrados, COCO enfatiza la comprensión contextual. Cada imagen suele contener múltiples objetos, interacciones y fondos variados, lo que hace que la detección y la segmentación sean más desafiantes y más cercanas a aplicaciones del mundo real. Las anotaciones incluyen máscaras de segmentación por instancia, cajas delimitadoras y puntos clave para posturas humanas, además de descripciones en lenguaje natural para cada imagen. Esta riqueza permite el entrenamiento y la evaluación simultáneos en tareas como segmentación de instancias, segmentación panóptica y descripción densa de imágenes.

Composición y Anotación del Conjunto de Datos

El conjunto de datos COCO fue lanzado en tres versiones principales: 2014, 2015 y 2017. La versión de 2017, la más utilizada, contiene 118.000 imágenes de entrenamiento, 5.000 imágenes de validación y 41.000 imágenes de test-dev. Las anotaciones incluyen instancias de objetos (con máscaras de segmentación poligonales), categorías de materia (como cielo, hierba), descripciones de imágenes y puntos clave de personas (17 articulaciones corporales). Las 80 clases de objetos se derivan de objetos comunes diarios, incluidos persona, bicicleta, coche, perro, gato y artículos de mobiliario. El proceso de anotación se realizó mediante de forma participativa a través de Amazon Mechanical Turk, con un riguroso control de calidad. Cada imagen es anotada por multiple trabajadores, y los resultados se fusionan y se verifican, garantizando una alta consistencia de etiquetas. El número medio de instancias por imagen es de 7.7, y cada imagen contiene alrededor de 3.5 categorías distintas, reflejando una complejidad realista de la vida real.

Métricas de Evaluación

COCO introdujo las métricas de evaluación estándar que se utilizan ampliamente en la investigación moderna en visión por computadora. La primaria métrica principal es la Precisión Promedio (AP) para el umbral de ÍoU (Intersección sobre Unión), con promedios sobre IoUs de 0.5 a 0.95 con un paso de 0.05. Esta métrica "COCO AP" premia una localización precisa. Los elementos secundarios incluyen AP a IoU de 0.5 y 0.75, así como valores de precisión para objetos pequeños, medianos y grandes para evaluar robustez ante la escala. Para tareas de segmentación, la AP se calcula usando IoU de máscaras en lugar de IoU de cajas. El servidor de evaluación oficial proporciona clasificaciones según las particiones test-dev y test-challenge, lo que ha impulsado rápidas mejoras en el rendimiento de los detectores. Desde 2015, COCO también alberga talleres y desafíos anuales, atrayendo a los principales equipos de investigación de academia y la industria, incluidos grupos de Carnegie Mellon University, Stanford AI Lab y BAIR (Berkeley AI Research).

Impacto en la Investigación en Visión por Computador

COCO ha sido fundamental en avanzar los modelos de detección y segmentación. Numerosas arquitecturas de referencia históricas se han evaluado en COCO, como Faster R-CNN (2015), Mask R-CNN (2017) y variantes de YOLO. La complejidad del conjunto de datos impulsó el campo hacia modelos más robustos, fomentando el desarrollo de redes piramidales de características, detectores sin anclas y mecanismos basados en atención. COCO también contribuyó al ascenso de visiones de modelos basados en Transformer (architecture), como DETR (Transformer de Detección) introducido en 2020, que trata la detección como un problema de predicción de conjunto. El conjunto de datos sirvió como un campo de entrenamiento y evaluación para millones de iteraciones de modelos, convirtiéndose en el estándar de facto para comparaciones entre pares en artículos académicos. Más allá de la detección, las anotaciones de descripciones de COCO estimularon la investigación en modelos de visión-lenguaje natural, que más tarde evolucionaron con avances en Generative AI y Large language model. La disponibilidad de puntos clave facilitó la investigación en estimación de posturas, influyendo en áreas como la interacción humano-computador y la robótica.

Extensiones y Recursos Comunitarios

Varios conjuntos de datos derivados y herramientas han surgido de COCO. El conjunto de datos COCO-Stuff (2017) agrega anotaciones a nivel de pixel para 91 categorías de materia, habilitando la segmentación panóptica. Las anotaciones de puntos clave se ampliaron para tareas de estimación de posturas con múltiples personas. El formato de COCO fue adoptado por muchos otros conjuntos de datos, como LVIS (Segmentación de Instancias de Gran Vocabulario) e Open Images, fomentando la interoperabilidad. La COCO API, un conjunto de herramientas en Python y MATLAB para cargar, visualizar y evaluar anotaciones, se ha convertido en una utilidad estándar. Además, el preentrenamiento en COCO es común para el aprendizaje por transferencia a otros dominios de visión. Trabajos recientes, como el modelo Segment Anything (SAM) de 2023, utilizaron COCO como parte de los datos de entrenamiento, demostrando su relevancia continua. En 2025, COCO sigue siendo un punto de referencia fundamental; aún así, conjuntos más nuevos con más categorías o imágenes de mayor resolución lo complementaron ocasionalmente.

Limitaciones y Críticas

A pesar de su éxito, COCO tiene limitaciones. Las 80 categorías son limitadas y tienen un sesgo hacia contextos occidentales, careciendo de muchos objetos específicos culturalmente. El conjunto de datos es estático, con imágenes recopiladas de 2014, y no refleja escenas contemporáneas. Existen errores de anotación, aunque son relativamente raros debido al acuerdo de múltiples trabajadores. La distribución de clases es desequilibrada, favoreciendo objetos comunes como 'persona' y 'coche' frente a objetos raros. La necesidad de anotaciones densas hace que ampliar el conjunto a más categorías sea costosoomísico. Los investigadores han propuesto el aprendizaje activo y la anotación automatizada, pero los costos de trabajo siguen siendo altos. Además, la métrica de COCO se centra en la precisión de localización, lo que puede mezclar errores semánticos y espaciales. A pesar de estos problemas, la influencia de COCO persiste, y se suele evaluar a nuevos modelos en este benchmark para obtener comparaciones como referencia, lo que asegura una visión dinámica de resultados.

Direcciones Futuras

El futuro de COCO como referencia está evolucionando con la aparición de conjuntos de datos más recientes como Objects365 (2019) y Open Images V6 (2019), que ofrecen más categorías o imágenes. Sin embargo, el legado de COCO está asegurado por su papel en definir las prácticas de evaluación. Actuales sistemas de Artificial intelligence , especialmente los que respaldan a vehículos autónomos y realidad aumentada, aún dependen de modelos entrenados en COCO para la percepción mediante Neural network. Los principios de diseño del conjunto - objetos contextuales, anotaciones densas y métricas de evaluación rigurosas – han influido en benchmarks posteriores como nuScenes para conducción autónoma o el desafío LVIS. Además, el flujo de trabajo de anotación de COCO ha informado la recolección de datos para conjuntos de entrenamiento en Generative AI . A medida que el campo avanza hacia detección de vocabulario abierto y modelos fundamentales, COCO sigue siendo uncuadro de validación importante, aunque los investigadores también usan subconjuntos personalizados para probar capacidades de aprendizaje en zero-shot. La contribución de reproducible science de COCO es profunda, proporcionando un terreno común para miles de millones de experimentos.

Ver también

Categoría:Conjuntos de datos de visión por computadora

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·object-detection·image-segmentation·benchmark-dataset
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial