COCO test-dev est une division de test désignée de l'ensemble de données Common Objects in Context (COCO), créée pour l'évaluation des modèles dans les défis de détection et de segmentation COCO. Contrairement à la division de test standard, test-dev est un ensemble « aveugle » : ses annotations de vérité terrain ne sont pas publiées publiquement. Les chercheurs soumettent leurs prédictions de modèles au serveur d'évaluation, qui calcule des métriques telles que la précision moyenne (mAP) et renvoie des scores. Ce protocole est conçu pour empêcher le surapprentissage de l'ensemble de test et pour garantir une comparaison équitable entre les méthodes concurrentes.
L'ensemble de données COCO a été introduit en 2014 par Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár et C. Lawrence Zitnick. Il contient plus de 200 000 images avec plus de 1,5 million d'instances d'objets étiquetées dans 80 catégories. L'ensemble de données est largement utilisé dans la recherche en vision par ordinateur pour des tâches telles que la détection d'objets, la segmentation d'instances et la détection de points clés. La division test-dev comprend environ 20 000 images, un sous-ensemble de l'ensemble de test complet, qui contient lui-même environ 40 000 images. Les images de test restantes sont utilisées pour la division « test-challenge », réservée à l'évaluation des défis et ne possédant également aucune annotation publique.
Protocole d'évaluation
Les participants aux défis COCO, tels que le COCO Detection Challenge organisé lors de la Conference on Computer Vision and Pattern Recognition (CVPR) à partir de 2015, soumettent leurs résultats pour la division test-dev. Le serveur d'évaluation calcule des métriques standard : la précision moyenne (AP) à des seuils IoU de 0,5 à 0,95 par pas de 0,05, l'AP à IoU 0,5, l'AP à IoU 0,75 et le rappel moyen (AR) pour différents nombres de détections. La métrique principale est l'AP à IoU 0,50:0,95, souvent appelée COCO AP. Cette métrique est plus stricte que la métrique traditionnelle PASCAL VOC, qui utilise un seul seuil IoU de 0,5.
La nature aveugle de test-dev signifie que les chercheurs ne peuvent pas itérer directement sur l'ensemble de test. Ils utilisent plutôt un ensemble de validation réservé (val2014 ou val2017) pour le développement et le réglage des hyperparamètres. La division test-dev n'est utilisée que pour les rapports finaux, ce qui aide à maintenir l'intégrité du benchmark. Au fil des ans, le serveur d'évaluation COCO est devenu une référence standard pour comparer les modèles de apprentissage automatique en détection d'objets, de nombreux systèmes de pointe rapportant leurs performances sur test-dev.
Contexte historique
COCO a été créé pour remédier aux limitations des ensembles de données antérieurs comme PASCAL VOC et ImageNet, qui avaient moins de catégories d'objets ou se concentraient sur la classification plutôt que sur la localisation. La division test-dev a été introduite dans le cadre de la conception de l'ensemble de données pour soutenir l'évaluation basée sur des défis. Le premier défi COCO a eu lieu en 2015, et les éditions suivantes ont eu lieu chaque année jusqu'en 2020, avec le dernier défi officiel lors de l'atelier ECCV 2020. Pendant cette période, test-dev est devenu le benchmark de facto pour comparer les algorithmes de détection et de segmentation.
L'ensemble de données a connu plusieurs versions : COCO 2014, COCO 2015 et COCO 2017. La division test-dev existe pour chaque version, mais la version 2017 est la plus couramment utilisée dans la recherche récente. Le test-dev 2017 contient 20 288 images, et ses annotations sont retenues. Le serveur d'évaluation pour COCO 2017 reste opérationnel, permettant aux chercheurs de soumettre des prédictions et d'obtenir des métriques.
Impact sur la recherche
COCO test-dev a joué un rôle déterminant dans la progression de la détection d'objets et de la segmentation d'instances. De nombreux modèles influents ont rapporté des résultats sur cette division, notamment Faster R-CNN, Mask R-CNN et les variantes YOLO. Par exemple, Mask R-CNN, introduit par Kaiming He et ses collègues en 2017, a atteint une AP de 37,1 sur test-dev, établissant un nouvel état de l'art à l'époque. Des modèles ultérieurs comme EfficientDet et Swin Transformer ont poussé l'AP au-dessus de 50. La disponibilité d'un ensemble de test aveugle standardisé a permis des comparaisons équitables et a accéléré le développement de techniques telles que les réseaux de pyramides de caractéristiques, les détecteurs sans ancres et les détecteurs basés sur des transformeurs.
Au-delà de la détection, test-dev est également utilisé pour évaluer la segmentation panoptique, une tâche introduite en 2018 qui combine la segmentation sémantique et la segmentation d'instances. Le défi panoptique COCO utilise une division test-dev distincte avec 80 catégories de choses et 91 catégories de matières. Cette extension a élargi l'utilité du benchmark.
Limites et alternatives
Malgré son utilisation répandue, test-dev présente des limites. Le petit nombre d'images (environ 20 000) par rapport à l'échelle des ensembles de données modernes peut entraîner des métriques bruitées, en particulier pour les catégories rares. De plus, le protocole d'évaluation aveugle nécessite de soumettre des prédictions à un serveur, ce qui peut être un obstacle pour les chercheurs sans accès à Internet ou pour ceux qui souhaitent évaluer sur du matériel local. Pour remédier à ces problèmes, certains chercheurs ont créé des benchmarks alternatifs, tels que LVIS (Large Vocabulary Instance Segmentation), qui possède un ensemble de catégories plus large et un protocole d'évaluation différent. Cependant, COCO test-dev reste un point de référence standard dans le domaine.
L'ensemble de données COCO lui-même est hébergé par le COCO Consortium, et le serveur d'évaluation est maintenu par l'équipe de l'Université du Michigan et d'autres contributeurs. En 2025, le serveur est toujours actif, bien que les défis officiels aient cessé. Les chercheurs continuent d'utiliser test-dev pour rapporter les résultats dans les articles, et il reste un benchmark courant dans la recherche en apprentissage profond et en intelligence artificielle.
Voir aussi
- vision par ordinateur
- détection d'objets
- segmentation d'instances
- précision moyenne