Traduit de l'anglais

RefCOCO est un ensemble de données pour la compréhension d'expressions référentielles, construit sur les images MS COCO avec des phrases en langage naturel et des annotations de boîtes englobantes, utilisé pour entraîner et évaluer les modèles vision-langage.

RefCOCO est un ensemble de données largement utilisé en vision par ordinateur et en traitement du langage naturel pour la tâche de compréhension d'expressions référentielles. Il se compose d'images provenant de l'ensemble de données Microsoft Common Objects in Context (MS COCO), chacune étant associée à des expressions référentielles en langage naturel qui identifient des objets spécifiques dans l'image, ainsi qu'à des annotations de boîtes englobantes correspondantes. Cet ensemble de données a été introduit pour soutenir la recherche sur l'ancrage du langage dans les objets visuels, une capacité fondamentale pour les systèmes qui doivent comprendre et interagir avec des scènes visuelles via le langage.

L'ensemble de données a été créé par des chercheurs de l'Université de Californie à Berkeley et a été présenté pour la première fois en 2014. Il contient plus de 50 000 expressions référentielles pour près de 20 000 objets répartis sur environ 19 000 images. Les expressions sont collectées via une interface de type jeu où les annotateurs décrivent des objets d'une manière qui les identifie de manière unique dans l'image, garantissant que les phrases sont contextuellement pertinentes et discriminantes. RefCOCO est devenu une référence standard pour évaluer les modèles qui effectuent la compréhension d'expressions référentielles, où l'objectif est de localiser l'objet décrit par une phrase donnée.

Structure et annotation

RefCOCO est construit sur l'ensemble de données MS COCO, qui fournit un ensemble diversifié d'images avec des masques de segmentation au niveau des instances. Les expressions référentielles dans RefCOCO sont de courtes phrases en langage naturel, généralement d'un à quelques mots, qui décrivent un objet par ses attributs, sa position ou sa relation avec d'autres objets. Par exemple, une phrase pourrait être « la voiture rouge à gauche » ou « la femme tenant un parapluie ». Chaque expression est associée à une boîte englobante qui entoure étroitement l'objet référencé. Les annotations sont divisées en ensembles d'entraînement, de validation et de test, l'ensemble de test étant lui-même divisé en deux sous-ensembles (TestA et TestB) pour évaluer la généralisation à différents types d'expressions.

Le processus d'annotation a impliqué une approche en deux étapes. Premièrement, les annotateurs ont vu une image et ont été invités à identifier tous les objets d'intérêt, qui ont ensuite été étiquetés avec des catégories de la taxonomie MS COCO. Deuxièmement, un groupe distinct d'annotateurs a été invité à décrire chaque objet d'une manière qui permettrait à une autre personne de l'identifier de manière unique. Ce processus a garanti que les expressions étaient naturelles et variées, capturant la manière dont les humains se réfèrent aux objets en contexte.

Définition de la tâche

La tâche principale associée à RefCOCO est la compréhension d'expressions référentielles, également connue sous le nom d'ancrage visuel. Étant donné une image et une expression en langage naturel, un modèle doit produire une boîte englobante qui localise l'objet référencé. Cette tâche nécessite que le modèle comprenne à la fois le contenu visuel et la sémantique du langage, y compris les attributs, les relations spatiales et les catégories d'objets. RefCOCO prend également en charge une tâche connexe de génération d'expressions référentielles, où le modèle doit produire une description en langage naturel pour un objet donné dans une image.

Les métriques d'évaluation pour la tâche de compréhension incluent généralement la précision à différents seuils d'Intersection sur Union (IoU), tels que IoU > 0,5, où la boîte englobante prédite doit chevaucher la boîte de vérité terrain de plus de la moitié. Cette métrique mesure à la fois la précision de localisation et la capacité à identifier correctement l'objet cible parmi les distracteurs.

Impact et utilisation

RefCOCO a joué un rôle déterminant dans l'avancement de la recherche sur la compréhension vision-langage. Il a été utilisé pour entraîner et évaluer de nombreux modèles, des approches précoces basées sur des architectures de apprentissage profond et de réseau de neurones aux modèles plus récents basés sur transformeur. L'ensemble de données a également engendré des variantes, telles que RefCOCO+ et RefCOCOg, qui diffèrent par le style et la complexité des expressions référentielles. RefCOCO+ se concentre sur des expressions qui décrivent l'apparence sans localisation, tandis que RefCOCOg contient des phrases plus longues et plus descriptives.

L'ensemble de données est souvent utilisé en conjonction avec d'autres références pour évaluer les performances des systèmes basés sur grand modèle de langage qui intègrent des entrées visuelles, tels que ceux développés par des organisations comme openai et google-deepmind. Il sert de banc d'essai pour les modèles de IA générative qui doivent ancrer le langage dans des données visuelles, une capacité critique pour des applications comme la légende d'images, la réponse à des questions visuelles et l'interaction homme-robot.

Défis et limites

Malgré son utilisation répandue, RefCOCO présente certaines limites. Les images proviennent de MS COCO, qui contient principalement des scènes quotidiennes avec des objets courants, limitant la diversité des domaines. Les expressions référentielles sont relativement courtes et peuvent ne pas capturer toute la complexité du langage naturel, comme les références pragmatiques ou ambiguës. De plus, l'ensemble de données présente un biais vers certaines catégories d'objets et configurations spatiales, ce qui peut entraîner un surapprentissage dans les modèles entraînés dessus.

Les chercheurs ont abordé certains de ces problèmes en créant des versions étendues ou en utilisant RefCOCO comme étape de pré-entraînement avant un ajustement fin sur des ensembles de données plus difficiles. L'ensemble de données reste une référence pour évaluer la capacité fondamentale d'ancrage visuel, et son utilisation continue reflète son importance dans le domaine de l'intelligence artificielle.

Travaux connexes et extensions

RefCOCO a inspiré une ligne de recherche sur la compréhension et la génération d'expressions référentielles. De nombreux modèles ont été proposés qui combinent des caractéristiques visuelles avec des plongements linguistiques, utilisant souvent des mécanismes d'attention pour aligner les mots avec les régions d'image. L'ensemble de données a également été utilisé pour étudier le rôle du contexte, comme l'influence des objets distracteurs sur la difficulté de compréhension. Des extensions comme RefCOCOg fournissent des expressions plus complexes, et d'autres ensembles de données ont été créés pour des expressions référentielles dans des vidéos ou des scènes 3D, mais RefCOCO reste une ressource fondamentale.

Le développement de RefCOCO s'aligne sur les tendances plus larges en apprentissage automatique et en vision par ordinateur, où de grands ensembles de données annotés sont cruciaux pour entraîner et évaluer les modèles. Il a été une ressource clé pour la communauté, permettant des comparaisons reproductibles et stimulant les progrès dans la compréhension multimodale.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·vision-language·referring-expression
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique