COCO 2017 est l'édition annuelle du défi Common Objects in Context (COCO), une référence à grande échelle pour la détection d'objets, la segmentation et la génération de légendes d'images. Publié en 2017 par l'équipe de recherche de Microsoft, il est devenu le jeu de données d'évaluation standard pour les modèles de vision par ordinateur, succédant aux versions antérieures de 2014 et 2015. Le jeu de données contient 118 000 images d'entraînement, 5 000 images de validation et 41 000 images de test, avec des annotations couvrant 80 catégories d'objets et 91 catégories de matériaux.
Les tâches du défi incluent la détection d'objets par boîtes englobantes, la segmentation d'instances, la segmentation panoptique (ajoutée plus tard) et la génération de légendes d'images. COCO 2017 a introduit une nouvelle division test-dev et des protocoles d'annotation raffinés, le rendant plus rigoureux que les éditions précédentes. Il est largement utilisé dans la recherche académique et les compétitions industrielles, avec des classements suivant les performances de pointe.
Composition du jeu de données
Le jeu de données COCO 2017 comprend plus de 200 000 images avec plus de 1,5 million d'instances annotées. Chaque image est annotée avec des boîtes englobantes d'objets, des masques de segmentation et des légendes. Les 80 catégories d'objets incluent des éléments courants comme personne, voiture, chien et chaise, tandis que les 91 catégories de matériaux couvrent des arrière-plans comme herbe, ciel et mur. Les images proviennent de Flickr et sont diverses en termes de composition de scène, d'éclairage et d'échelle des objets.
Les annotations sont fournies au format JSON, chaque image ayant plusieurs entrées d'annotation. L'ensemble d'entraînement est utilisé pour l'entraînement des modèles, tandis que l'ensemble de validation sert au réglage des hyperparamètres et à la sélection des modèles. L'ensemble de test est utilisé pour l'évaluation finale, avec des annotations non divulguées au public pour éviter le surapprentissage.
Métriques d'évaluation
COCO 2017 utilise les métriques d'évaluation standard de COCO, principalement la précision moyenne (AP) et le rappel moyen (AR). L'AP est calculée à plusieurs seuils d'Intersection sur Union (IoU), de 0,5 à 0,95 par pas de 0,05, puis moyennée. Cette métrique est plus stricte que la métrique traditionnelle PASCAL VOC, qui utilise un IoU fixe de 0,5. La métrique principale est AP@[0,5:0,95], souvent désignée simplement par AP.
Pour les tâches de segmentation, les mêmes métriques sont appliquées aux prédictions de masques. Pour la génération de légendes, des métriques comme BLEU, METEOR et CIDEr sont utilisées. Le défi suit également la vitesse d'inférence, avec une catégorie de latence distincte certaines années.
Impact sur la vision par ordinateur
COCO 2017 est devenu la référence de facto pour la recherche en détection d'objets et en segmentation. De nombreux modèles influents ont été évalués sur ce jeu de données, notamment les détecteurs basés sur ResNet, les variantes de U-Net et plus tard les architectures basées sur les transformeurs. Le jeu de données a stimulé les progrès dans l'apprentissage de caractéristiques multi-échelles, la détection sans ancres et la segmentation d'instances.
Son échelle importante et ses annotations diverses ont permis le développement de techniques de augmentation de données et de méthodes de normalisation par lots. Le défi a également encouragé la recherche en apprentissage faiblement supervisé et semi-supervisé, car les annotations de l'ensemble de test sont cachées.
Éditions du défi et gagnants
COCO 2017 faisait partie d'une série de défis annuels. L'édition 2017 a vu la participation de grandes entreprises technologiques et d'institutions académiques. Les équipes gagnantes utilisaient souvent des modèles d'ensemble et des stratégies d'entraînement avancées. Par exemple, le gagnant de la détection en 2017 a atteint une AP de 0,493, une amélioration significative par rapport aux 0,375 du gagnant de 2015.
Le format du défi comprenait des pistes distinctes pour la détection, la segmentation et la génération de légendes. La piste de segmentation se concentrait sur les masques au niveau des instances, tandis que la piste de génération de légendes exigeait de produire des descriptions en langage naturel. L'édition 2017 a également introduit une nouvelle tâche de segmentation des matériaux, qui a ensuite évolué en segmentation panoptique en 2018.
Héritage et avenir
COCO 2017 reste largement utilisé même après l'introduction de jeux de données plus récents comme LVIS et Open Images. Ses annotations sont toujours la norme pour évaluer de nombreux modèles de apprentissage profond. Le jeu de données a été intégré dans des outils populaires comme Detectron2 et MMDetection, le rendant accessible aux chercheurs du monde entier.
En 2025, COCO 2017 continue d'être un point de référence pour les performances des modèles, bien que des références plus récentes comme Open Images de Google Cloud et les jeux de données publics de AWS offrent des défis alternatifs. Le consortium COCO a publié des éditions ultérieures, mais 2017 reste la version la plus citée et utilisée dans la littérature.