RefCOCOg est un ensemble de données de référence en vision par ordinateur et en traitement du langage naturel, conçu pour la tâche de compréhension et de génération d'expressions référentielles. Il a été introduit pour remédier aux limitations des ensembles de données d'expressions référentielles antérieurs, notamment la nécessité d'un langage plus long, plus descriptif et dépendant du contexte. L'ensemble de données fournit un banc d'essai difficile pour les modèles qui doivent aligner les informations visuelles avec les descriptions linguistiques, une capacité essentielle pour des applications telles que l'interaction homme-robot, l'édition d'images et la réponse à des questions visuelles.
L'ensemble de données contient 104 560 expressions référentielles pour 54 822 objets répartis sur 26 711 images, toutes issues de l'ensemble de données Microsoft COCO (Common Objects in Context). Une caractéristique clé de RefCOCOg est que ses expressions sont plus longues et plus naturelles que celles de prédécesseurs comme RefCOCO, nécessitant souvent une compréhension des relations entre plusieurs objets dans une scène. Par exemple, une expression pourrait être « l'homme en chemise bleue debout à côté de la voiture rouge », ce qui exige d'ancrer à la fois l'objet principal et son contexte relationnel.
Construction et annotation
RefCOCOg a été créé par une équipe de chercheurs, le processus d'annotation impliquant des annotateurs humains chargés d'écrire des descriptions identifiant de manière unique un objet cible dans une image. Les annotations ont été collectées via une plateforme de crowdsourcing, et chaque expression a été validée pour garantir son absence d'ambiguïté. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, ce dernier étant lui-même subdivisé en deux sous-ensembles selon que les annotateurs ont vu l'image pendant l'entraînement (appelés « refexp » et « refexp+ »). Cette conception de division aide à évaluer la généralisation à des annotateurs et des styles de langage non vus.
Formulation de la tâche
La tâche principale associée à RefCOCOg est la compréhension d'expressions référentielles, où un modèle reçoit une image et une description textuelle et doit localiser l'objet décrit, généralement en prédisant une boîte englobante ou un masque de segmentation. Une tâche connexe est la génération d'expressions référentielles, où le modèle doit produire une description en langage naturel pour un objet donné dans une image. Les deux tâches sont évaluées à l'aide de métriques standard : l'intersection sur union (IoU) pour la compréhension et des métriques comme CIDEr ou BLEU pour la génération.
Impact sur le développement des modèles
RefCOCOg a été largement utilisé pour entraîner et évaluer des modèles d'apprentissage profond, en particulier ceux basés sur les architectures transformers et les mécanismes d'attention multi-têtes. Les approches précoces utilisaient des backbones de réseaux résiduels pour l'extraction de caractéristiques visuelles combinés à des réseaux neuronaux récurrents pour l'encodage du langage. Les systèmes plus récents exploitent les grands modèles de langage et les modèles vision-langage, intégrant souvent des couches d'attention croisée pour fusionner les modalités visuelles et textuelles. L'accent mis par l'ensemble de données sur les expressions plus longues a poussé le développement de modèles capables de raisonner sur les relations spatiales, les attributs et le contexte, allant au-delà de la simple détection d'objets.
Relation avec d'autres ensembles de données
RefCOCOg fait partie d'une famille d'ensembles de données d'expressions référentielles, incluant RefCOCO et RefCOCO+, introduits à peu près à la même époque. Alors que RefCOCO se concentre sur des expressions plus courtes et plus concises, RefCOCO+ restreint les expressions à des descriptions basées sur l'apparence, évitant les mots de localisation. RefCOCOg se distingue par ses descriptions plus longues et plus conversationnelles qui nécessitent souvent une compréhension holistique de la scène. Ensemble, ces ensembles de données sont devenus des références standard dans le domaine, avec des classements suivant les performances de pointe sur chacun d'eux.
Défis et limites
Malgré son utilité, RefCOCOg présente des limites connues. L'ensemble de données est dérivé de MS COCO, qui a un biais vers les catégories d'objets courantes et les scènes quotidiennes, ce qui peut limiter la diversité. Les expressions, bien que plus longues, peuvent ne pas capturer toute la complexité de la référence humaine dans les interactions réelles, comme l'utilisation de gestes ou de connaissances partagées. De plus, l'évaluation basée sur des boîtes englobantes peut être grossière, et certaines expressions peuvent être ambiguës même pour les humains. Les chercheurs ont proposé des extensions et des ensembles de données alternatifs pour combler ces lacunes, mais RefCOCOg reste une ressource fondamentale pour l'étude de la compréhension du langage ancré.
Voir aussi
- intelligence artificielle
- apprentissage automatique
- apprentissage profond
- réseau de neurones
- vision par ordinateur (non listé, mais connexe ; utiliser MIT CSAIL comme pôle de recherche)
- laboratoire d'IA de Stanford
- recherche en IA de Berkeley
Références
L'ensemble de données a été introduit dans l'article « Grounded Language Understanding: Referring Expression Comprehension and Generation » de Junhua Mao, Jonathan Huang, Alexander Toshev, Oana Camburu, Alan Yuille et Kevin Murphy, présenté à la conférence européenne sur la vision par ordinateur (ECCV) en 2016.