Traduit de l'anglais

MS COCO Captions est un ensemble de données à grande échelle de phrases rédigées par des humains décrivant des images du corpus Microsoft COCO, avec cinq légendes par image. Il sert de référence standard pour entraîner et évaluer les modèles de légende d’images.

MS COCO Captions est un ensemble de données à grande échelle de phrases rédigées par des humains décrivant des images de la collection Microsoft Common Objects in Context (COCO). Il fournit cinq légendes indépendantes pour chacune de plus de 330 000 images, ce qui en fait une référence standard pour la recherche en intelligence artificielle dans la compréhension vision-langage.

Cet ensemble de données a été créé pour soutenir la tâche de légendage d'images, où un modèle doit générer une description en langage naturel d'une image. Son échelle, sa diversité et la qualité de ses annotations en font une ressource fondamentale en apprentissage automatique et en apprentissage profond.

Historique et création

L'ensemble de données Microsoft COCO a été publié pour la première fois en 2014 dans le cadre d'un effort visant à faire progresser la reconnaissance d'objets et la compréhension de scènes. Les annotations de légendes ont été collectées via Amazon Mechanical Turk, où les travailleurs devaient décrire les objets, actions et relations importants dans chaque image. En 2015, un article compagnon de Xinlei Chen et ses collègues a détaillé la méthodologie de collecte et introduit un serveur d'évaluation. L'ensemble de données final contient 328 000 images, chacune avec cinq légendes, totalisant environ 1,5 million de phrases.

Statistiques et structure de l'ensemble de données

Chaque légende est une phrase en anglais, généralement de 10 à 12 mots, et le vocabulaire complet couvre environ 10 000 mots. Les images couvrent 80 catégories d'objets et incluent des scènes complexes avec plusieurs objets en interaction. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, les légendes de test étant retenues pour l'évaluation. La répartition originale de 2014 comprend 82 783 images d'entraînement, 40 504 images de validation et 40 775 images de test. Cette structure soutient l'évaluation reproductible des modèles de réseaux de neurones.

Évaluation et références

MS COCO Captions est la référence principale pour la tâche de légendage d'images. Des métriques automatiques telles que BLEU, METEOR, ROUGE, CIDEr et SPICE sont utilisées pour comparer les sorties des modèles aux cinq légendes de référence. Le serveur d'évaluation, hébergé par le projet COCO, permet aux chercheurs de soumettre leurs résultats pour l'ensemble de test retenu. Les premiers systèmes de pointe utilisaient des architectures encodeur-décodeur avec apprentissage séquence à séquence. Les avancées ultérieures ont intégré des modèles transformers et des mécanismes de attention multi-têtes, souvent initialisés à partir de grands modèles de langage. Ces modèles utilisent fréquemment des couches de attention croisée pour aligner les caractéristiques visuelles avec le texte, et le décodage repose généralement sur la recherche en faisceau pour générer des légendes fluides.

Impact et applications

L'ensemble de données a stimulé les progrès en IA générative pour les tâches vision-langage. Il est utilisé pour entraîner des modèles de génération automatique de textes alternatifs, de recherche d'images et de réponse à des questions visuelles. Les annotations ont également été adaptées pour la augmentation de données dans d'autres tâches de vision par ordinateur, telles que la détection d'objets et la segmentation. Les chercheurs ont utilisé MS COCO Captions pour étudier la généralisation compositionnelle, l'alignement intermodal et la robustesse des systèmes d'apprentissage profond.

Limites et extensions

Malgré son succès, MS COCO Captions présente des limites connues. Les images représentent principalement des scènes quotidiennes de contextes occidentaux, et les légendes peuvent refléter des biais culturels. Le vocabulaire est relativement restreint et les phrases sont plus courtes que les descriptions humaines typiques. Pour remédier à ces problèmes, les chercheurs ont créé des extensions telles que COCO-CN pour les légendes en chinois et l'ensemble de données nocaps pour le légendage à vocabulaire ouvert. Ces efforts continuent d'influencer la conception de nouvelles références en intelligence artificielle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·image-captioning·computer-vision·natural-language-processing
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique