MS COCO Captions est un ensemble de données largement utilisé dans le domaine de l'apprentissage automatique et de l'intelligence artificielle pour la tâche de légende d'images. Il a été créé par des chercheurs de Microsoft et des collaborateurs académiques, en s'appuyant sur les images de l'ensemble de données Microsoft Common Objects in Context (COCO). L'ensemble de données fournit une grande collection d'images associées à plusieurs descriptions en langage naturel écrites par des humains, permettant l'entraînement et l'évaluation de modèles qui génèrent des descriptions textuelles de contenu visuel.
L'objectif principal de MS COCO Captions est de soutenir la recherche en légende d'images, une tâche qui fait le pont entre la vision par ordinateur et le traitement du langage naturel. Chaque image de l'ensemble de données est associée à au moins cinq légendes indépendantes écrites par des humains, qui capturent différents aspects, objets et activités de la scène. Cette multiplicité de légendes est conçue pour refléter la diversité de la perception et du langage humains, fournissant une référence robuste pour évaluer la capacité des modèles à générer des descriptions précises et variées.
Composition et statistiques de l'ensemble de données
L'ensemble de données MS COCO Captions est dérivé de l'ensemble de données COCO, publié pour la première fois en 2014. L'ensemble de données COCO contenait à l'origine 328 000 images, avec 2,5 millions d'instances étiquetées d'objets réparties dans 80 catégories. Pour l'extension des légendes, les organisateurs ont collecté plus de 1,5 million de légendes auprès d'annotateurs humains via Amazon Mechanical Turk. Les images sont réparties en ensembles d'entraînement, de validation et de test, avec la répartition standard utilisant 82 783 images pour l'entraînement, 40 504 pour la validation et 40 775 pour les tests. Les légendes ont généralement une longueur d'environ 10 à 12 mots, et la taille du vocabulaire est d'environ 10 000 mots uniques après prétraitement.
Processus de création et d'annotation
Pour construire l'ensemble de données, l'équipe COCO a fait appel à des travailleurs participatifs sur Amazon Mechanical Turk. Chaque image a été montrée à cinq annotateurs différents, qui ont reçu pour instruction d'écrire une phrase unique décrivant l'image de manière naturelle et factuelle. Ils étaient encouragés à mentionner les objets, les actions et les relations présents, mais pas à inclure d'opinions personnelles ou de détails invérifiables. Les directives d'annotation mettaient l'accent sur l'utilisation de phrases complètes et sur l'évitement de formulations trop complexes ou ambiguës. Ce processus a abouti à un ensemble diversifié de légendes par image, ce qui s'est avéré améliorer la robustesse des modèles entraînés sur ces données.
Rôle dans le développement des modèles
MS COCO Captions est devenu une référence standard pour la recherche en légende d'images. Les premiers modèles, tels que ceux basés sur des architectures de réseau neuronal avec des encodeurs et décodeurs transformeur, ont été fréquemment évalués sur cet ensemble de données. L'ensemble de données est également utilisé en conjonction avec le serveur d'évaluation COCO, qui calcule des métriques comme BLEU, METEOR, ROUGE et CIDEr pour comparer les performances des modèles. Ces métriques mesurent le chevauchement entre les légendes générées et les légendes de référence, CIDEr étant spécifiquement conçu pour les tâches de légende d'images. La disponibilité d'un ensemble de données vaste et de haute qualité a accéléré les progrès dans le domaine, permettant aux chercheurs de développer et de tester des modèles de plus en plus sophistiqués.
Extensions et variantes
Le succès de MS COCO Captions a conduit à plusieurs extensions et variantes. Une variante notable est l'ensemble de données COCO-CN, qui fournit des légendes en chinois pour un sous-ensemble d'images COCO. Une autre est l'ensemble de données Conceptual Captions, qui, bien qu'il ne soit pas directement dérivé de COCO, suit une philosophie similaire de collecte de paires image-texte à grande échelle à partir du web. De plus, l'ensemble de données COCO original a été utilisé pour d'autres tâches telles que la détection d'objets et la segmentation, ce qui en fait une ressource polyvalente en vision par ordinateur. Les légendes ont également été utilisées dans des études sur la IA générative, où des modèles génèrent de nouvelles images à partir de descriptions textuelles, car les légendes fournissent une source riche de correspondances texte-image.
Impact et limites
MS COCO Captions a eu un impact significatif sur le développement des systèmes de légende d'images, y compris ceux utilisés dans les technologies d'assistance pour les personnes malvoyantes et dans la description automatique de vidéos. Cependant, l'ensemble de données présente des limites. Les images sont principalement des photographies de consommation, qui peuvent ne pas couvrir tous les domaines visuels, et les légendes tendent à décrire les objets et actions les plus saillants, manquant potentiellement des informations subtiles ou contextuelles. De plus, le processus d'annotation peut introduire des biais, car les annotateurs étaient principalement des locuteurs natifs de l'anglais issus d'un contexte culturel spécifique. Malgré ces limites, l'ensemble de données reste une ressource fondamentale dans le domaine, et son influence peut être observée dans de nombreux ensembles de données et modèles ultérieurs.