MS COCO, acronyme de Microsoft Common Objects in Context, est un jeu de données d'images à grande échelle conçu pour faire progresser la recherche en détection d'objets, segmentation et légendage d'images. Publié par Microsoft en 2014, il fournit un ensemble riche d'images représentant des scènes quotidiennes avec plusieurs objets dans des contextes naturels, répondant aux limitations des jeux de données antérieurs qui présentaient des objets uniques et centrés. Ce jeu de données est devenu une référence standard pour évaluer les algorithmes de vision par ordinateur, en particulier dans les domaines du apprentissage automatique et du apprentissage profond.
MS COCO contient plus de 330 000 images, avec plus de 200 000 étiquetées et 1,5 million d'instances d'objets réparties dans 80 catégories d'objets. Chaque image comprend des annotations détaillées telles que des boîtes englobantes, des masques de segmentation et des légendes, permettant des tâches comme la segmentation d'instances et le légendage d'images. L'accent mis sur le contexte - les objets apparaissant dans leurs environnements typiques - rend ce jeu de données plus difficile et plus réaliste que des jeux de données antérieurs comme ImageNet ou PASCAL VOC, qui présentaient souvent des objets isolés.
Structure du jeu de données et annotations
Le jeu de données MS COCO est organisé en trois divisions principales : entraînement (environ 118 000 images), validation (environ 5 000 images) et test (environ 41 000 images). Les annotations sont fournies au format JSON, incluant des étiquettes de catégories, des masques de segmentation basés sur des polygones et cinq légendes rédigées par des humains par image. Les 80 catégories couvrent des objets courants tels que personne, voiture, chien et meubles, avec un accent sur les vues non iconiques - des objets photographiés sous différents angles et échelles, souvent partiellement occlus.
Au-delà de la détection et de la segmentation, MS COCO inclut une tâche de détection de points clés pour l'estimation de pose humaine, avec 17 articulations corporelles annotées par personne. Cette extension, introduite en 2017, a soutenu les avancées dans les architectures de réseaux de neurones pour l'estimation de pose. Le jeu de données prend également en charge le légendage dense, où les régions sont décrites avec des phrases courtes, et la segmentation panoptique, qui combine la segmentation sémantique et celle d'instances.
Impact sur la recherche en vision par ordinateur
MS COCO a stimulé des progrès significatifs en vision par ordinateur depuis son introduction. Le défi annuel de détection COCO, organisé de 2015 à 2019, est devenu un lieu clé pour comparer les modèles de pointe. Les approches gagnantes employaient souvent des architectures de réseaux résiduels et des réseaux de pyramides de caractéristiques, conduisant à des améliorations régulières de la précision moyenne (mAP). Par exemple, le gagnant de 2015 a atteint environ 37 % de mAP, tandis qu'en 2019, les meilleurs modèles dépassaient 50 % de mAP, reflétant des avancées algorithmiques rapides.
Le jeu de données a également été essentiel pour entraîner et évaluer des modèles de légendage d'images. Les premiers systèmes de légendage utilisaient des réseaux de neurones récurrents avec des mécanismes d'attention, tandis que les approches modernes exploitent des architectures transformers et des composants de grands modèles de langage. Les légendes de MS COCO sont devenues un corpus d'entraînement standard pour les modèles multimodaux, reliant la compréhension visuelle à la génération de langage naturel.
Jeux de données associés et extensions
Plusieurs jeux de données ont été dérivés ou inspirés de MS COCO. COCO-Stuff ajoute des étiquettes sémantiques au niveau des pixels pour 91 classes de matériaux (par exemple, ciel, herbe, mur), complétant les catégories d'objets d'origine. LVIS (Large Vocabulary Instance Segmentation) étend les catégories de COCO à plus de 1 200 classes, offrant une référence plus granulaire. De plus, COCO a été utilisé pour créer des jeux de données synthétiques pour des tâches comme la segmentation panoptique et la segmentation d'instances vidéo, où les annotations sont propagées entre les images.
Dans le contexte de la IA générative, les images et légendes de MS COCO sont fréquemment utilisées pour entraîner des modèles texte-à-image, tels que ceux développés par OpenAI et Google DeepMind. Les scènes diverses et les légendes descriptives du jeu de données aident les modèles à apprendre la correspondance entre le langage et le contenu visuel, une base pour des systèmes comme DALL-E et Stable Diffusion.
Limitations et critiques
Malgré son utilisation répandue, MS COCO présente des limitations. Le jeu de données est biaisé vers des scènes urbaines occidentales, avec une représentation limitée des environnements ruraux ou non occidentaux, ce qui peut conduire à des performances de modèle biaisées. Les 80 catégories sont fixes, restreignant l'évaluation à un ensemble prédéfini d'objets. De plus, le processus d'annotation est intensif en main-d'œuvre et coûteux, limitant l'évolutivité vers des jeux de données plus grands ou plus diversifiés.
Les chercheurs ont également noté que les métriques d'évaluation de COCO, en particulier la mAP, peuvent ne pas capturer pleinement la robustesse des modèles face aux changements de domaine ou aux exemples adverses. Par conséquent, de nouvelles références comme Open Images et Objects365 ont émergé, offrant une plus grande échelle ou différents types d'annotations. Néanmoins, MS COCO reste une ressource fondamentale, citée dans des milliers d'articles et utilisée comme corpus de pré-entraînement pour de nombreux modèles de vision.
Héritage et pertinence continue
En 2025, MS COCO continue d'être une référence principale pour la détection d'objets et la segmentation, malgré l'émergence de jeux de données plus récents. Ses annotations ont été intégrées dans de nombreux outils open source, tels que Detectron2 et MMDetection, largement utilisés dans le monde académique et industriel. Le jeu de données sert également de terrain commun pour comparer les modèles entre différents groupes de recherche, favorisant la reproductibilité dans la recherche en intelligence artificielle.
Le format COCO est devenu une norme de facto pour l'annotation, adopté par des outils comme LabelMe et CVAT. Cette standardisation simplifie le partage de données et l'évaluation des modèles, contribuant à l'influence durable du jeu de données. Bien que des jeux de données à grande échelle comme LAION-5B aient dépassé COCO en taille pour l'entraînement de modèles génératifs, les annotations curatées de COCO et son statut de référence garantissent son utilisation continue dans des contextes d'évaluation rigoureux.