Traduit de l'anglais

COCO Captions 2015 est un ensemble de données comprenant cinq légendes rédigées par des humains pour chaque image de la collection COCO 2014/2015, utilisé pour entraîner et évaluer les modèles de génération de légendes d'images en vision par ordinateur et en traitement du langage naturel.

COCO Captions 2015 est un ensemble de données de référence largement utilisé pour la génération de légendes d'images, composé de cinq descriptions rédigées indépendamment par des humains pour chaque image des collections Microsoft COCO (Common Objects in Context) 2014 et 2015. Cet ensemble a été introduit pour soutenir la recherche en intelligence artificielle et en apprentissage automatique, en particulier pour les tâches nécessitant la génération de descriptions en langage naturel du contenu visuel. Chaque légende est une phrase complète qui décrit les objets, les actions et les relations présents dans l'image correspondante, fournissant une source riche de données alignées vision-langage.

Les légendes ont été collectées via Amazon Mechanical Turk, avec des instructions données aux travailleurs pour décrire toutes les parties importantes de l'image en une seule phrase. L'ensemble de données comprend plus de 330 000 images, chacune associée à cinq légendes, produisant plus de 1,5 million de paires légende-image. COCO Captions 2015 est devenu un ensemble d'évaluation standard pour les modèles combinant des techniques de apprentissage profond en vision par ordinateur et en traitement du langage naturel, utilisant souvent des architectures de réseaux de neurones telles que les modèles encodeur-décodeur. La conception de l'ensemble encourage la diversité dans la formulation, car différents annotateurs décrivent la même scène de manières variées, ce qui teste la capacité d'un modèle à produire un texte fluide et sémantiquement précis.

Structure et statistiques

L'ensemble de données COCO Captions 2015 est organisé en divisions d'entraînement, de validation et de test, la division de test étant elle-même subdivisée en un ensemble de test public et un ensemble de test réservé utilisé pour l'évaluation officielle. La division d'entraînement contient environ 82 783 images, la division de validation en contient 40 504, et la division de test en contient 40 775. Chaque image est associée à cinq légendes, mais les légendes de l'ensemble de test ne sont pas publiées publiquement pour éviter le surapprentissage ; à la place, les chercheurs soumettent leurs prédictions à un serveur d'évaluation. Les légendes varient en longueur, allant généralement de 8 à 25 mots, et couvrent une large gamme de scènes quotidiennes, y compris des personnes, des animaux, des véhicules et des environnements intérieurs/extérieurs.

Métriques d'évaluation

Les métriques d'évaluation standard pour COCO Captions 2015 incluent BLEU, METEOR, ROUGE-L et CIDEr. CIDEr (Consensus-based Image Description Evaluation) a été spécifiquement conçu pour la génération de légendes d'images et mesure le consensus entre une légende générée et l'ensemble des références humaines en utilisant des chevauchements de n-grammes pondérés par TF-IDF. Le script d'évaluation officiel de l'ensemble de données calcule ces métriques sur l'ensemble de test réservé, et les classements suivent la performance des modèles de pointe. En 2015, les systèmes les plus performants atteignaient des scores BLEU-4 autour de 0,30 et des scores CIDEr autour de 1,0, mais les avancées ultérieures dans les architectures basées sur les transformeurs et le pré-entraînement de grands modèles de langage ont considérablement amélioré ces chiffres.

Rôle dans le développement des modèles

COCO Captions 2015 a joué un rôle déterminant dans le développement des systèmes modernes de génération de légendes d'images. Les approches précoces utilisaient des architectures de réseaux résiduels ou de U-Net pour l'extraction de caractéristiques visuelles, combinées à des réseaux de neurones récurrents pour la génération de texte. Plus tard, les mécanismes de attention multi-têtes et de attention croisée, introduits dans l'architecture transformeur, ont remplacé les composants récurrents, permettant un entraînement parallèle plus efficace. L'ensemble de données a également facilité la recherche en augmentation de données et en apprentissage curriculaire, ainsi que l'utilisation de stratégies de décodage comme la recherche en faisceau et l'échantillonnage top-p. De nombreux modèles de IA générative, y compris ceux de OpenAI et Google DeepMind, ont utilisé COCO Captions 2015 comme référence de pré-entraînement ou d'évaluation, bien que des ensembles plus récents comme Flickr30k et Visual Genome aient émergé.

Limites et héritage

L'ensemble de données présente des limites connues, notamment un biais vers les objets courants et les structures de phrases simples, ainsi qu'un bruit d'annotation potentiel provenant des travailleurs de la foule. Il manque également de relations spatiales fines et de défis de raisonnement compositionnel présents dans des références plus récentes. Malgré ces problèmes, COCO Captions 2015 reste une ressource fondamentale pour comparer les méthodes de génération de légendes d'images et pour étudier l'alignement vision-langage. Sa conception de cinq légendes par image a influencé les ensembles de données ultérieurs, et son protocole d'évaluation continue d'être utilisé dans la recherche académique. L'ensemble de données est librement disponible pour un usage académique, et ses annotations sont largement citées dans la littérature.

Références et extensions connexes

Les extensions de COCO Captions 2015 incluent COCO-CN, qui ajoute des légendes en chinois, et nocaps, qui se concentre sur la génération de légendes pour des objets nouveaux. L'ensemble de données chevauche également les tâches de détection et de segmentation COCO, permettant un apprentissage multitâche. Les chercheurs combinent souvent COCO Captions 2015 avec d'autres ensembles de données pour améliorer la généralisation, et il reste un choix courant pour tester les modèles séquence-à-séquence dans les tâches vision-langage. L'influence de l'ensemble de données s'étend aux offres d'Amazon Web Services et de Google Cloud, qui fournissent des versions prétraitées pour l'entraînement de modèles dans le cloud.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·image-captioning·computer-vision·natural-language-processing
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique