COCO Captions est un ensemble de données de référence largement utilisé pour la légende d'images, une tâche en intelligence artificielle où un système génère une description en langage naturel d'une image. Il a été introduit comme une extension de l'ensemble de données Microsoft Common Objects in Context (COCO), qui contient plus de 330 000 images avec des annotations pour la détection et la segmentation d'objets. COCO Captions fournit cinq légendes rédigées par des humains pour chacune des quelque 150 000 images des ensembles d'entraînement et de validation, permettant à la fois l'entraînement et l'évaluation de modèles de apprentissage automatique. L'ensemble de données est conçu pour tester la capacité d'un modèle à comprendre le contenu visuel, à raisonner sur les relations et le contexte, et à produire des phrases fluides et sémantiquement précises.
Les légendes de COCO Captions se distinguent par leur diversité et leur naturel. Contrairement aux ensembles de données de légendes antérieurs, qui contenaient souvent des descriptions formulaires ou basées sur des modèles prédéfinis, les légendes de COCO Captions ont été collectées auprès d'annotateurs humains avec pour consigne de décrire l'image comme le ferait une personne voyante, en incluant des détails sur les actions, les interactions et la scène globale. Il en résulte des légendes qui varient en style, en longueur et en focus, capturant à la fois les objets saillants et le contexte plus large. Par exemple, une image de cuisine pourrait être légendée « Une personne préparant de la nourriture sur un comptoir » ou « Une cuisine moderne avec des appareils en acier inoxydable et une table en bois ». Cette richesse rend l'ensemble de données exigeant, car les modèles doivent apprendre à hiérarchiser l'information et à générer des légendes non seulement précises, mais aussi variées et semblables à celles des humains.
Métriques d'évaluation et approches courantes
L'évaluation standard de COCO Captions utilise des métriques automatiques telles que BLEU, METEOR, ROUGE et CIDEr, cette dernière (Consensus-based Image Description Evaluation) étant particulièrement adaptée à la tâche de légende, car elle mesure le consensus entre les légendes générées et les légendes de référence. Ces métriques comparent le chevauchement de n-grammes et la similarité sémantique, bien qu'elles présentent des limites connues pour saisir le jugement humain. En pratique, les chercheurs effectuent également des évaluations humaines pour une appréciation qualitative.
Les premières approches de COCO Captions reposaient sur des architectures de réseaux de neurones combinant un réseau de neurones convolutif (CNN) pour l'extraction de caractéristiques d'image avec un réseau de neurones récurrent (RNN), souvent un réseau à mémoire à long terme (LSTM), pour la génération de séquences. Ces modèles encodeur-décodeur ont établi la performance de référence. L'introduction des architectures de transformeurs et des méthodes basées sur les grands modèles de langage, telles que le pré-entraînement vision-langage, a conduit à des améliorations significatives. Des modèles comme CLIP et les transformeurs multimodaux ultérieurs, y compris ceux développés par OpenAI et Google DeepMind, ont atteint des résultats de pointe en alignant les représentations visuelles et textuelles dans un espace d'intégration partagé.
Structure de l'ensemble de données et variantes
COCO Captions est organisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant utilisé pour le classement officiel des performances. Chaque image est associée à cinq légendes, et l'ensemble de données comprend au total plus de 500 000 légendes. Les images couvrent 80 catégories d'objets, y compris des éléments courants comme les personnes, les véhicules, les animaux et les objets ménagers, et sont issues de scènes de la vie quotidienne. L'ensemble de données a été étendu de plusieurs manières, notamment avec la variante COCO-CN pour les légendes en chinois et le benchmark nocaps, qui teste la généralisation à de nouveaux objets et scènes. Ces variantes conservent le même ensemble d'images mais introduisent de nouveaux défis pour la génération de légendes.
Une caractéristique clé réside dans les catégories « stuff », qui incluent des éléments d'arrière-plan comme le ciel, l'herbe et les murs, en plus des catégories « thing » (objets discrets). Cela encourage les modèles à décrire la scène dans son ensemble plutôt que seulement les objets au premier plan. Le processus d'annotation a fait appel à des travailleurs de la foule sur Amazon Mechanical Turk, à qui des directives spécifiques ont été données pour éviter les descriptions trop simples ou répétitives, garantissant ainsi une grande variabilité.
Impact et limites
COCO Captions est devenu une référence de facto pour l'évaluation des systèmes de légende d'images, influençant la recherche en apprentissage profond, en IA générative et en compréhension multimodale. Il a été utilisé dans des centaines d'articles publiés et sert de benchmark dans les grandes conférences et compétitions. L'ensemble de données a également stimulé le développement de tâches connexes, telles que la réponse à des questions visuelles et la génération de texte à partir d'images, en fournissant une source riche de paires image-texte.
Cependant, l'ensemble de données présente des limites notables. Les images sont biaisées vers des scènes occidentales et quotidiennes, et les légendes reflètent les normes culturelles et linguistiques des annotateurs, ce qui peut conduire les modèles à apprendre des stéréotypes. Les métriques d'évaluation ne capturent pas pleinement la qualité des légendes, comme l'exactitude factuelle ou les erreurs subtiles. De plus, l'ensemble fixe de légendes par image peut limiter l'évaluation de la diversité des légendes générées. Les chercheurs ont proposé des benchmarks complémentaires, comme l'ensemble de données Flickr30k, bien que COCO Captions reste le plus largement utilisé en raison de son échelle et de sa standardisation.
Développements récents et orientations futures
Avec l'essor des grands modèles vision-langage, COCO Captions est souvent utilisé comme ensemble de réglage fin ou d'évaluation plutôt que comme source principale d'entraînement. Des modèles pré-entraînés sur des données massives provenant du web, tels que ceux développés par Anthropic et Google DeepMind, sont évalués sur COCO Captions pour mesurer leurs capacités en matière de légende d'images en zero-shot ou en few-shot. Le benchmark a également été adapté pour évaluer la génération de légendes dans des domaines spécifiques, comme l'imagerie médicale ou la conduite autonome, en créant des sous-ensembles ou des versions modifiées.
Les travaux futurs se concentrent sur la résolution des limites de l'ensemble de données, notamment en développant des métriques d'évaluation plus robustes qui s'alignent mieux sur le jugement humain, en élargissant la diversité et l'inclusivité des images et des légendes, et en créant des benchmarks dynamiques capables d'évoluer avec les capacités des modèles. Au milieu des années 2020, COCO Captions reste une ressource fondamentale dans le domaine, mais les chercheurs le complètent de plus en plus avec de nouveaux ensembles de données et des cadres d'évaluation pour repousser les limites de la compréhension et de la génération de langage à partir d'images.