Flickr30k Entities est un ensemble de données pour l'ancrage de phrases, la tâche consistant à relier des phrases en langage naturel dans des légendes aux régions correspondantes dans des images. Il a été créé en étendant l'ensemble de données de légendes d'images Flickr30k avec des annotations détaillées qui connectent les mentions textuelles d'entités à leurs emplacements visuels. L'ensemble de données est largement utilisé dans la recherche en vision par ordinateur et en apprentissage automatique multimodal pour entraîner et évaluer des modèles qui doivent comprendre la relation entre le langage et le contenu visuel.
L'ensemble de données contient 31 783 boîtes englobantes qui localisent les référents visuels des syntagmes nominaux dans les images. Il fournit également 244 000 chaînes de coréférence, qui regroupent différentes mentions de la même entité à travers plusieurs légendes pour une seule image. Cette structure permet aux chercheurs d'étudier non seulement l'alignement direct phrase-région, mais aussi la résolution de coréférence inter-phrases dans un contexte multimodal. Les annotations couvrent un vocabulaire large d'objets quotidiens, de personnes et d'animaux, ce qui en fait un benchmark réaliste pour la compréhension du langage ancré.
Structure des annotations
Chaque image dans Flickr30k Entities est associée à cinq légendes indépendantes écrites par des humains. Les annotateurs ont identifié des syntagmes nominaux dans ces légendes et ont lié chaque phrase à une boîte englobante dans l'image lorsqu'un référent visuel existait. Lorsque la même entité était mentionnée plusieurs fois, soit dans une légende, soit à travers les cinq légendes, les mentions étaient regroupées dans une chaîne de coréférence. Cette conception permet l'évaluation de modèles sur la localisation de phrases et le raisonnement au niveau des entités, où un modèle doit agréger des preuves provenant de multiples références textuelles.
Les boîtes englobantes sont des rectangles alignés sur les axes qui entourent étroitement l'objet référencé. L'ensemble de données ne fournit pas de masques de segmentation, se concentrant plutôt sur une localisation grossière suffisante pour les tâches d'ancrage. Les chaînes de coréférence sont essentielles pour les tâches qui exigent qu'un modèle suive une entité à travers différentes descriptions, comme la réponse à des questions visuelles ou la récupération d'images basée sur l'état d'une entité.
Construction et statistiques
L'ensemble de données a été construit sur la base du corpus original Flickr30k, qui comprend 31 783 images collectées sur le site de partage de photos Flickr. Les images représentent une grande variété de scènes, y compris des personnes engagées dans des activités, des animaux et des objets quotidiens. Les annotations d'entités ont été produites via un pipeline de crowdsourcing, avec des mesures de contrôle qualité pour assurer la cohérence. L'ensemble de données final comprend 244 000 chaînes de coréférence et 31 783 boîtes englobantes, avec une moyenne d'environ une boîte englobante par image, bien que de nombreuses images contiennent plusieurs entités.
Une caractéristique notable est l'inclusion de phrases qui se réfèrent à des entités non présentes visuellement dans l'image. Celles-ci sont marquées comme telles, permettant aux modèles d'apprendre à distinguer les références ancrées des références non ancrées. Cet aspect est important pour les applications du monde réel où les légendes peuvent mentionner des objets hors du cadre.
Utilisation dans la recherche
Flickr30k Entities est devenu un benchmark standard pour l'ancrage de phrases et la compréhension d'expressions référentielles. Les modèles sont généralement évalués sur leur capacité à prédire la boîte englobante correcte pour un syntagme nominal donné. L'ensemble de données a été utilisé pour entraîner et tester une variété d'architectures, y compris celles basées sur les modèles transformers et les approches réseaux de neurones. Il est également un composant courant dans l'évaluation des systèmes vision-langage basés sur modèles de langage de grande taille, qui utilisent souvent l'ensemble de données pour mesurer la compréhension visuelle fine.
Les chercheurs ont utilisé l'ensemble de données pour développer des méthodes d'ancrage faiblement supervisé, où les modèles apprennent à partir de paires image-légende sans supervision explicite des boîtes englobantes, et pour l'ancrage entièrement supervisé. Les annotations de coréférence ont également permis des travaux sur la résolution de coréférence multimodale, une tâche qui combine la coréférence linguistique avec des preuves visuelles. L'ensemble de données complète d'autres ressources comme Visual Genome et referitgame, chacune offrant différentes granularités d'annotation et défis.
Limites et extensions
L'ensemble de données hérite de biais de la collection originale Flickr30k, qui tend à présenter une photographie occidentale et orientée vers le consommateur. Les légendes sont relativement courtes et décrivent des objets saillants, ce qui peut ne pas refléter la complexité de domaines plus spécialisés. Les boîtes englobantes sont grossières et ne capturent pas les occlusions ou les détails au niveau des parties. Malgré ces limites, l'ensemble de données reste une ressource précieuse en raison de son échelle et de la richesse de ses annotations de coréférence.
Plusieurs extensions ont été proposées, y compris l'augmentation de l'ensemble de données avec des attributs supplémentaires ou son utilisation pour générer des données d'entraînement synthétiques pour d'autres tâches. L'ensemble de données a également été intégré dans des benchmarks plus larges qui combinent plusieurs ensembles de données d'ancrage pour tester la généralisation à travers les domaines. Au début des années 2020, il continue d'être cité dans des centaines d'articles en vision par ordinateur et en traitement du langage naturel.
Voir aussi
- ancrage de phrases
- Visual Genome
- referitgame
- légende d'images