Traduit de l'anglais

Flickr30k est un ensemble de données de référence largement utilisé pour la description d'images, contenant plus de 31 000 images provenant de Flickr, chacune annotée avec cinq descriptions en langage naturel indépendantes. Il sert d'ensemble d'évaluation standard pour les modèles d'apprentissage automatique qui génèrent des descriptions textuelles de contenu visuel.

Flickr30k est un ensemble de données de référence pour la génération de légendes d'images, introduit en 2014 par des chercheurs de l'Université de l'Illinois à Urbana-Champaign et d'autres institutions. L'ensemble comprend 31 783 photographies provenant du site de partage de photos Flickr, chacune associée à cinq légendes rédigées par des humains, ce qui donne plus de 158 000 paires légende-image. Il a été conçu pour soutenir le développement et l'évaluation de systèmes d'intelligence artificielle capables de générer automatiquement des descriptions en langage naturel d'images, une tâche située à l'intersection de la vision par ordinateur et du traitement du langage naturel.

Flickr30k est rapidement devenu un point de référence standard dans le domaine de l'apprentissage automatique, aux côtés d'ensembles de données antérieurs comme Flickr8k et de l'ensemble plus vaste Microsoft COCO. Sa taille relativement modeste, comparée aux 330 000 images de COCO, le rend particulièrement adapté au prototypage rapide et à l'entraînement de modèles avec des ressources informatiques limitées. Les légendes de l'ensemble se distinguent par leur diversité, couvrant des scènes, des personnes, des animaux et des activités variés, ce qui aide les modèles à acquérir un large vocabulaire de concepts visuels et de constructions linguistiques.

Construction et annotation

Les images de Flickr30k ont été collectées sur le site de partage de photos Flickr, sélectionnées pour inclure une grande variété de scènes et de sujets. Chaque image a été annotée avec cinq phrases en anglais indépendantes, rédigées par des travailleurs participants recrutés via Amazon Mechanical Turk. Le processus d'annotation a mis l'accent sur des descriptions naturelles et proches du langage humain, plutôt que sur des légendes basées sur des modèles prédéfinis, ce qui contribue à la richesse linguistique de l'ensemble. La version originale comprenait un total de 158 915 légendes pour 31 783 images, avec une répartition standard de 29 000 images pour l'entraînement, 1 000 pour la validation et 1 783 pour le test.

Rôle dans la recherche en apprentissage automatique

Flickr30k a joué un rôle fondamental dans le développement des systèmes de génération de légendes d'images au sein des domaines plus larges de l'apprentissage automatique et de l'apprentissage profond. Les premières approches neuronales, telles que celles reposant sur des architectures encodeur-décodeur basées sur des réseaux de neurones, ont fréquemment utilisé Flickr30k comme principal banc d'essai d'évaluation. L'ensemble a contribué à établir la tâche consistant à générer des descriptions fluides et sémantiquement précises à partir d'entrées visuelles, complétant ainsi l'ensemble Microsoft COCO, plus vaste mais moins diversifié. Les chercheurs ont utilisé Flickr30k pour comparer différentes architectures de modèles, y compris celles intégrant des mécanismes d'attention basés sur les transformeurs, ainsi que pour étudier l'alignement intermodal entre les images et le texte.

Extensions et variantes

L'ensemble de données a donné lieu à plusieurs extensions notables. L'ensemble Flickr30k Entities, publié en 2017, a ajouté des annotations de mise en correspondance au niveau des phrases, reliant les mentions textuelles de personnes, d'objets et d'actions à des régions spécifiques des images. Cette extension a permis des recherches sur la compréhension des expressions référentielles et la génération de langage ancré dans le visuel. Une autre variante, Flickr30k-CNA, a introduit des corrections issues du crowdsourcing pour remédier aux erreurs et aux biais d'annotation. Ces dérivés ont élargi l'utilité de l'ensemble original au-delà de la simple génération de légendes, vers des tâches visuo-linguistiques plus fines.

Métriques d'évaluation et bancs d'essai

Flickr30k est couramment utilisé avec des métriques d'évaluation automatiques standard pour la génération de légendes, notamment BLEU, METEOR, ROUGE et CIDEr. Ces métriques mesurent le chevauchement de n-grammes, la similarité sémantique et la concordance avec les références humaines. L'ensemble a également été intégré dans des bancs d'essai composites qui évaluent la robustesse des modèles face aux changements de distribution et aux perturbations adverses. Bien que des ensembles de données plus récents, tels que ceux construits à partir de paires image-texte à l'échelle du web, aient gagné en taille, Flickr30k demeure un environnement de test compact et bien compris pour des expériences contrôlées, en particulier dans les contextes académiques où les ressources informatiques sont limitées.

Limites et critiques

Malgré sa popularité, Flickr30k présente des limites connues. Les images proviennent principalement des États-Unis et d'Europe occidentale, ce qui entraîne des biais culturels et géographiques dans les légendes. Le style d'annotation, bien que naturel, peut être répétitif, avec un usage fréquent de phrases comme « un homme » ou « une femme » sans précision supplémentaire. La taille de l'ensemble est modeste par rapport aux corpus modernes issus du web, ce qui peut limiter l'entraînement de très grands modèles. Les chercheurs ont également noté que le schéma d'annotation à cinq références, bien qu'utile, ne capture pas toute la diversité des descriptions humaines possibles. Ces facteurs ont motivé la création d'ensembles de données plus vastes et plus diversifiés, mais Flickr30k continue de servir de point de comparaison fiable dans la littérature.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·image-captioning·computer-vision·natural-language-processing
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique