Traducido del inglés

COCO test-dev es la división de prueba ciega del conjunto de datos COCO, utilizada para evaluar modelos de detección de objetos y segmentación en desafíos, con anotaciones retenidas de la publicación pública.

COCO test-dev es una división de prueba designada del conjunto de datos Common Objects in Context (COCO), creada para la evaluación de modelos en los desafíos de detección y segmentación de COCO. A diferencia de la división de prueba estándar, test-dev es un conjunto "ciego": sus anotaciones de verdad fundamental no se publican públicamente. Los investigadores envían las predicciones de sus modelos al servidor de evaluación, que calcula métricas como la precisión promedio media (mAP) y devuelve puntuaciones. Este protocolo está diseñado para prevenir el sobreajuste al conjunto de prueba y garantizar una comparación justa entre los métodos competidores.

El conjunto de datos COCO fue introducido en 2014 por Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár y C. Lawrence Zitnick. Contiene más de 200,000 imágenes con más de 1.5 millones de instancias de objetos etiquetadas en 80 categorías. El conjunto de datos se utiliza ampliamente en la investigación de visión por computadora para tareas como detección de objetos, segmentación de instancias y detección de puntos clave. La división test-dev incluye aproximadamente 20,000 imágenes, un subconjunto del conjunto de prueba completo, que a su vez contiene alrededor de 40,000 imágenes. Las imágenes de prueba restantes se utilizan para la división "test-challenge", que está reservada para la evaluación de desafíos y tampoco tiene anotaciones públicas.

Protocolo de Evaluación

Los participantes en los desafíos COCO, como el Desafío de Detección COCO celebrado en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) desde 2015, envían resultados para la división test-dev. El servidor de evaluación calcula métricas estándar: Precisión Promedio (AP) en umbrales de IoU de 0.5 a 0.95 en pasos de 0.05, AP en IoU 0.5, AP en IoU 0.75 y recuerdo promedio (AR) para diferentes números de detecciones. La métrica principal es AP en IoU 0.50:0.95, a menudo denominada COCO AP. Esta métrica es más estricta que la métrica tradicional de PASCAL VOC, que utiliza un único umbral de IoU de 0.5.

La naturaleza ciega de test-dev significa que los investigadores no pueden iterar directamente sobre el conjunto de prueba. En su lugar, suelen utilizar un conjunto de validación reservado (val2014 o val2017) para el desarrollo y el ajuste de hiperparámetros. La división test-dev se utiliza solo para el informe final, lo que ayuda a mantener la integridad del punto de referencia. Con los años, el servidor de evaluación de COCO se ha convertido en un estándar para comparar modelos de aprendizaje automático en detección de objetos, y muchos sistemas de última generación informan su rendimiento en test-dev.

Contexto Histórico

COCO se creó para abordar las limitaciones de conjuntos de datos anteriores como PASCAL VOC e ImageNet, que tenían menos categorías de objetos o se centraban en la clasificación en lugar de la localización. La división test-dev se introdujo como parte del diseño del conjunto de datos para apoyar la evaluación basada en desafíos. El primer desafío COCO se celebró en 2015, y las ediciones posteriores se realizaron anualmente hasta 2020, con el último desafío oficial en el taller ECCV de 2020. Durante este período, test-dev se convirtió en el punto de referencia de facto para comparar algoritmos de detección y segmentación.

El conjunto de datos ha tenido múltiples versiones: COCO 2014, COCO 2015 y COCO 2017. La división test-dev existe para cada versión, pero la versión de 2017 es la más utilizada en la investigación reciente. El test-dev de 2017 contiene 20,288 imágenes, y sus anotaciones están retenidas. El servidor de evaluación para COCO 2017 sigue operativo, lo que permite a los investigadores enviar predicciones y obtener métricas.

Impacto en la Investigación

COCO test-dev ha sido fundamental para impulsar el progreso en la detección de objetos y la segmentación de instancias. Muchos modelos influyentes han informado resultados en esta división, incluidos Faster R-CNN, Mask R-CNN y variantes de YOLO. Por ejemplo, Mask R-CNN, introducido por Kaiming He y sus colegas en 2017, logró una AP de 37.1 en test-dev, estableciendo un nuevo estado del arte en ese momento. Modelos posteriores como EfficientDet y Swin Transformer han superado una AP de 50. La disponibilidad de un conjunto de prueba ciego estandarizado ha permitido comparaciones justas y ha acelerado el desarrollo de técnicas como redes de pirámides de características, detectores sin anclas y detectores basados en transformadores.

Más allá de la detección, test-dev también se utiliza para evaluar la segmentación panóptica, una tarea introducida en 2018 que combina la segmentación semántica y de instancias. El desafío panóptico de COCO utiliza una división test-dev separada con 80 categorías de cosas y 91 categorías de material. Esta extensión ha ampliado la utilidad del punto de referencia.

Limitaciones y Alternativas

A pesar de su uso generalizado, test-dev tiene limitaciones. El pequeño número de imágenes (alrededor de 20,000) en comparación con la escala de los conjuntos de datos modernos puede dar lugar a métricas ruidosas, especialmente para categorías raras. Además, el protocolo de evaluación ciega requiere enviar predicciones a un servidor, lo que puede ser una barrera para investigadores sin acceso a internet o para aquellos que desean evaluar en hardware local. Para abordar estos problemas, algunos investigadores han creado puntos de referencia alternativos, como LVIS (Segmentación de Instancias de Vocabulario Amplio), que tiene un conjunto de categorías más grande y un protocolo de evaluación diferente. Sin embargo, COCO test-dev sigue siendo un punto de referencia estándar en el campo.

El conjunto de datos COCO en sí está alojado por el Consorcio COCO, y el servidor de evaluación es mantenido por el equipo de la Universidad de Michigan y otros colaboradores. A partir de 2025, el servidor sigue activo, aunque los desafíos oficiales han cesado. Los investigadores continúan utilizando test-dev para informar resultados en artículos, y sigue siendo un punto de referencia común en la investigación de aprendizaje profundo y inteligencia artificial.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·benchmark·evaluation
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial