Traduit de l'anglais

Microsoft COCO est un jeu de données à grande échelle pour la détection d'objets, la segmentation et le sous-titrage, contenant plus de 330 000 images avec des annotations détaillées. Il sert de référence pour les modèles de vision par ordinateur et a stimulé les avancées en apprentissage profond.

Microsoft COCO (Common Objects in Context) est un ensemble de données à grande échelle pour la détection d'objets, la segmentation et le sous-titrage, publié par Microsoft en 2014. Il contient plus de 330 000 images, dont plus de 200 000 sont annotées, avec 80 catégories d'objets et 91 catégories de matériaux de fond. Chaque image comprend plusieurs annotations, telles que des boîtes englobantes, des masques de segmentation et des légendes en langage naturel, ce qui en fait une ressource complète pour l'entraînement et l'évaluation de modèles de vision par ordinateur.

L'ensemble de données a été introduit pour remédier aux limitations des ensembles antérieurs comme ImageNet, qui se concentraient principalement sur la classification d'images. COCO met l'accent sur la compréhension contextuelle en représentant les objets dans leur environnement naturel, avec des scènes complexes contenant plusieurs objets, des instances qui se chevauchent et des relations spatiales variées. Cette conception a fait de COCO une référence standard pour des tâches telles que la détection d'objets, la segmentation d'instances et le sous-titrage d'images, stimulant les progrès dans la recherche en apprentissage profond et en apprentissage automatique.

Structure de l'ensemble de données et annotations

COCO fournit des masques de segmentation au niveau du pixel pour les instances d'objets, permettant une évaluation précise des algorithmes de segmentation. Les 80 catégories d'objets incluent des éléments courants comme personne, voiture et chien, tandis que les 91 catégories de matériaux de fond couvrent des éléments d'arrière-plan tels que l'herbe, le ciel et la route. Les annotations sont stockées au format JSON, chaque image étant liée à un ensemble de fichiers d'annotation. L'ensemble de données est divisé en ensembles d'entraînement (118 000 images), de validation (5 000) et de test (20 000), l'ensemble de test ayant des étiquettes cachées pour l'évaluation des défis.

En plus de la détection et de la segmentation, COCO inclut cinq légendes en langage naturel par image, générées par des annotateurs humains, facilitant la recherche en sous-titrage d'images et en tâches vision-langage. L'ensemble de données fournit également des annotations de points clés pour l'estimation de pose humaine, avec 17 points clés par personne, et une segmentation des matériaux de fond pour la compréhension de scène.

Impact sur la recherche en vision par ordinateur

COCO est devenu une norme de facto pour l'évaluation des modèles de détection d'objets et de segmentation. Le défi COCO, organisé chaque année depuis 2015, a stimulé la concurrence entre les principaux groupes de recherche, y compris ceux de BAIR (Berkeley AI Research) et Stanford AI Lab. De nombreuses architectures de pointe, telles que réseau résiduel et U-Net, ont été évaluées sur COCO, conduisant à des améliorations significatives en précision et en efficacité. La complexité de l'ensemble de données a également encouragé le développement de techniques de augmentation de données et de méthodes de normalisation par lots pour gérer des scènes diverses.

De plus, la tâche de sous-titrage de COCO a fait progresser les modèles basés sur IA générative et transformeurs, car les chercheurs utilisent l'ensemble de données pour entraîner des modèles qui génèrent du texte descriptif à partir d'images. Cela a influencé la conception de grands modèles de langage qui intègrent la vision et le langage, comme ceux développés par OpenAI et Google DeepMind.

Métriques de référence et évaluation

COCO définit des métriques standard pour la détection et la segmentation, y compris la précision moyenne (AP) à plusieurs seuils d'intersection sur union (IoU), allant de 0,5 à 0,95. La métrique principale, AP@[0,5:0,95], fait la moyenne de l'AP sur les seuils IoU, fournissant une mesure complète de la précision de localisation. Pour la segmentation, les mêmes métriques sont appliquées aux prédictions de masques. Pour le sous-titrage, des métriques comme BLEU, METEOR et CIDEr sont utilisées pour évaluer la qualité des légendes générées par rapport aux références humaines.

L'ensemble de données comprend également un ensemble test-dev pour les soumissions de défis, avec des résultats publiés sur le serveur d'évaluation officiel. Cela a permis une comparaison équitable entre les modèles, stimulant des progrès rapides dans le domaine.

Extensions et variantes

Plusieurs extensions de COCO ont été publiées pour répondre à des besoins de recherche spécifiques. COCO-Stuff ajoute des annotations au niveau du pixel pour les classes de matériaux de fond, tandis que COCO-Text se concentre sur la détection et la reconnaissance de texte dans des scènes naturelles. La segmentation panoptique combine les classes de matériaux de fond et d'objets en une tâche unifiée, COCO fournissant les annotations nécessaires. Ces variantes ont élargi l'applicabilité de l'ensemble de données, soutenant la recherche en intelligence artificielle et en vision par ordinateur au-delà de la détection d'objets traditionnelle.

Limitations et critiques

Malgré son utilisation répandue, COCO présente des limitations. L'ensemble de données est biaisé vers des objets et des scènes courants, avec une représentation limitée des catégories rares ou des contextes inhabituels. Du bruit et des incohérences dans les annotations ont été notés, en particulier dans les masques de segmentation. De plus, la taille et la complexité de l'ensemble de données nécessitent des ressources informatiques importantes pour l'entraînement, ce qui peut entraver l'accessibilité pour les petits groupes de recherche. Certains chercheurs ont également soulevé des préoccupations éthiques concernant l'utilisation d'ensembles de données présentant des problèmes potentiels de confidentialité, car les images peuvent contenir des individus identifiables.

Conclusion

Microsoft COCO a joué un rôle central dans l'avancement de la vision par ordinateur en fournissant un ensemble de données riche et annoté qui défie les modèles à comprendre les objets en contexte. Ses références sont devenues standard dans le domaine, influençant à la fois la recherche académique et les applications industrielles. Alors que le apprentissage profond continue d'évoluer, COCO reste une ressource fondamentale, bien que les futurs ensembles de données puissent remédier à ses limitations pour soutenir des systèmes d'IA plus robustes et impartiaux.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·computer-vision·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique