Traduit de l'anglais

COCO (Common Objects in Context) est un ensemble de données d’images à grande échelle destiné à la détection d’objets, à la segmentation et au sous-titrage, contenant plus de 330 000 images avec 2,5 millions d’instances annotées réparties sur 80 catégories d’objets, largement utilisé comme référence en vision par ordinateur.

COCO (Common Objects in Context) est un jeu de données à grande échelle pour les tâches de vision par ordinateur, principalement la détection d'objets, la segmentation et le sous-titrage d'images. Créé par des chercheurs de Microsoft en 2014, il a été conçu pour pallier les limites des jeux de données antérieurs en se concentrant sur les objets dans leur contexte naturel, avec des images non iconiques comprenant plusieurs objets et des scènes complexes. Le jeu de données comprend plus de 330 000 images, dont plus de 200 000 sont étiquetées, avec 2,5 millions d'instances étiquetées réparties dans 80 catégories d'objets. COCO est devenu une référence standard pour l'évaluation des modèles de Machine learning dans les tâches de vision, facilitant les progrès dans les architectures de Deep learning et la conception de Neural network.

Contrairement aux prédécesseurs qui présentaient des objets uniques centrés, COCO met l'accent sur la compréhension contextuelle. Chaque image contient généralement plusieurs objets, des interactions et des arrière-plans variés, rendant la détection et la segmentation plus difficiles et plus proches des applications réelles. Les annotations comprennent des masques de segmentation par instance, des boîtes englobantes et des points clés pour les poses humaines, ainsi que des légendes en langage naturel pour chaque image. Cette richesse permet l'entraînement et l'évaluation simultanés sur des tâches telles que la segmentation d'instances, la segmentation panoptique et le sous-titrage dense.

Composition du jeu de données et annotation

Le jeu de données COCO a été publié en trois versions majeures : 2014, 2015 et 2017. La version 2017, la plus couramment utilisée, contient 118 000 images d'entraînement, 5 000 images de validation et 41 000 images de test-dev. Les annotations incluent des instances d'objets (avec des masques de segmentation polygonaux), des catégories de matière (telles que le ciel, l'herbe), des légendes d'images et des points clés de personnes (17 articulations du corps). Les 80 classes d'objets sont dérivées d'objets courants de la vie quotidienne, notamment les personnes, les vélos, les voitures, les chiens, les chats et les meubles. Le processus d'annotation a été réalisé par crowdsourcing via Amazon Mechanical Turk, avec un contrôle qualité rigoureux. Chaque image est annotée par plusieurs travailleurs, et les résultats sont fusionnés et vérifiés, garantissant une cohérence élevée des étiquettes. Le nombre moyen d'instances par image est de 7,7, et chaque image contient environ 3,5 catégories distinctes, reflétant la complexité du monde réel.

Métriques d'évaluation

COCO a introduit les métriques d'évaluation standard largement utilisées dans la recherche moderne en vision. La métrique principale est la précision moyenne (AP) aux seuils d'Intersection sur Union (IoU), agrégée sur des IoU de 0,5 à 0,95 avec un pas de 0,05. Cette métrique « AP COCO » récompense une localisation précise. Les métriques secondaires incluent l'AP à IoU 0,5 et 0,75, ainsi que l'AP pour les objets petits, moyens et grands afin d'évaluer la robustesse à l'échelle. Pour les tâches de segmentation, l'AP est calculée en utilisant l'IoU de masque plutôt que l'IoU de boîte. Le serveur d'évaluation officiel fournit des classements sur les divisions test-dev et test-challenge, qui ont stimulé des améliorations rapides des performances des détecteurs. Depuis 2015, COCO organise également des ateliers et des défis annuels, attirant les meilleurs groupes de recherche du monde académique et industriel, y compris des équipes de Carnegie Mellon University, Stanford AI Lab et BAIR (Berkeley AI Research).

Impact sur la recherche en vision par ordinateur

COCO a joué un rôle déterminant dans l'avancement de la détection d'objets et de la segmentation. De nombreuses architectures marquantes ont été évaluées sur COCO, notamment Faster R-CNN (2015), Mask R-CNN (2017) et les variantes YOLO. La complexité du jeu de données a poussé le domaine vers des modèles plus robustes, encourageant le développement de réseaux pyramidaux de caractéristiques, de détecteurs sans ancres et de mécanismes basés sur l'attention. COCO a également contribué à l'essor des modèles de vision basés sur Transformer (architecture), tels que DETR (Detection Transformer) introduit en 2020, qui traite la détection comme un problème de prédiction d'ensemble. Le jeu de données a servi de terrain d'entraînement et d'évaluation pour des millions d'itérations de modèles, devenant la norme de facto pour la comparaison entre pairs dans les articles académiques. Au-delà de la détection, les annotations de légendes de COCO ont stimulé la recherche sur les modèles vision-langage, qui ont ensuite évolué avec les avancées en Generative AI et en Large language model. La disponibilité des points clés a facilité la recherche sur l'estimation de pose, influençant des domaines comme l'interaction homme-machine et la robotique.

Extensions et ressources communautaires

Plusieurs jeux de données dérivés et outils ont émergé de COCO. Le jeu de données COCO-Stuff (2017) ajoute des annotations au niveau des pixels pour 91 classes de matière, permettant la segmentation panoptique. Les annotations de points clés ont été étendues pour les tâches d'estimation de pose multi-personnes. Le format de COCO a été adopté par de nombreux autres jeux de données, tels que LVIS (Large Vocabulary Instance Segmentation) et Open Images, favorisant l'interopérabilité. L'API COCO, une boîte à outils Python et MATLAB pour charger, visualiser et évaluer les annotations, est devenue un utilitaire standard. De plus, le pré-entraînement sur COCO est courant pour l'apprentissage par transfert dans d'autres domaines de la vision. Des travaux récents, tels que le Segment Anything Model (SAM) de 2023, ont utilisé COCO comme partie des données d'entraînement, démontrant sa pertinence continue. En 2025, COCO reste une référence de référence, bien que des jeux de données plus récents avec plus de catégories ou une résolution d'image plus élevée le complètent occasionnellement.

Limites et critiques

Malgré son succès, COCO présente des limites. Les 80 catégories sont limitées et biaisées vers les contextes occidentaux, manquant de nombreux objets culturellement spécifiques. Le jeu de données est statique, avec des images collectées à partir de 2014, et ne reflète pas les scènes contemporaines. Des erreurs d'annotation existent, bien qu'elles soient relativement faibles en raison de l'accord multi-travailleurs. La distribution des classes est déséquilibrée, favorisant les objets courants comme « personne » et « voiture » par rapport aux objets rares. L'exigence d'annotations denses rend la mise à l'échelle à plus de catégories coûteuse en raison des coûts de main-d'œuvre. Les chercheurs ont proposé l'apprentissage actif et l'annotation automatisée pour résoudre ce problème, mais les coûts restent élevés. De plus, la métrique de COCO se concentre sur la précision de localisation, ce qui peut confondre les erreurs sémantiques et spatiales. Malgré ces problèmes, l'influence de COCO persiste, et il est souvent la première référence utilisée pour évaluer de nouvelles architectures, garantissant un flux continu de résultats comparatifs.

Directions futures

L'avenir de COCO en tant que référence évolue avec l'avènement de jeux de données plus récents comme Objects365 (2019) et Open Images V6 (2019), qui offrent plus de catégories ou d'images. Cependant, l'héritage de COCO est assuré par son rôle dans la définition des pratiques d'évaluation. Les systèmes modernes d'Artificial intelligence, en particulier ceux qui alimentent les véhicules autonomes et la réalité augmentée, s'appuient encore sur des modèles entraînés sur COCO pour la perception par Neural network. Les principes de conception du jeu de données - objets contextuels, annotations denses et métriques rigoureuses - ont influencé des références ultérieures telles que nuScenes pour la conduite autonome et le défi LVIS. De plus, le pipeline d'annotation de COCO a informé la collecte de données pour les ensembles d'entraînement en Generative AI. Alors que le domaine évolue vers la détection à vocabulaire ouvert et les modèles de fondation, COCO reste un ensemble de validation critique, bien que les chercheurs utilisent également des sous-ensembles personnalisés pour tester la généralisation zéro-shot. La contribution du jeu de données à la science reproductible est profonde, fournissant un terrain commun pour des millions d'expériences.

Voir aussi

Catégorie:Jeux de données de vision par ordinateur

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·object-detection·image-segmentation·benchmark-dataset
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique