Traduit de l'anglais

RefCOCOg est un ensemble de données de compréhension d'expressions référentielles construit sur l'ensemble d'images COCO, proposant des descriptions en langage naturel plus longues et plus naturelles pour les tâches d'ancrage visuel dans la recherche en IA.

RefCOCOg est un ensemble de données pour la compréhension d'expressions référentielles, une tâche en vision par ordinateur et en traitement du langage naturel où un système doit localiser un objet spécifique dans une image en fonction d'une description textuelle. Il a été introduit comme une extension de l'ensemble de données RefCOCO antérieur, avec un accent sur des phrases plus longues et plus descriptives qui ressemblent à un langage généré par des humains. L'ensemble de données est construit sur la collection d'images Microsoft COCO (Common Objects in Context), qui contient plus de 330 000 images avec des annotations détaillées d'objets.

La distinction principale de RefCOCOg réside dans ses descriptions. Contrairement aux ensembles de données antérieurs qui utilisaient souvent des phrases courtes basées sur des modèles prédéfinis, RefCOCOg fournit des phrases plus longues et plus naturelles qui incluent des informations contextuelles, des relations spatiales et des détails d'attributs. Par exemple, une description pourrait être « l'homme en chemise bleue debout à côté de la voiture rouge », plutôt que simplement « l'homme ». Cela rend l'ensemble de données plus difficile et plus réaliste pour évaluer des modèles qui doivent comprendre à la fois le contenu visuel et la nuance linguistique.

Construction de l'ensemble de données

RefCOCOg a été créé par des chercheurs de l'Université de Caroline du Nord à Chapel Hill et a été présenté pour la première fois dans un article de 2016. L'ensemble de données a été assemblé à l'aide d'une plateforme de crowdsourcing, où des travailleurs ont vu des images de COCO et ont été invités à écrire des descriptions qui identifiaient de manière unique un objet spécifique dans l'image. Les instructions mettaient l'accent sur la génération de phrases naturelles et semblables à celles des humains plutôt que sur l'utilisation de modèles prédéfinis. Ce processus a abouti à environ 104 560 expressions référentielles pour 54 822 objets répartis sur 26 711 images.

L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test. Une répartition courante, appelée RefCOCOg-google, utilise une répartition 90/10 pour l'entraînement et la validation, avec un ensemble de test séparé. Une autre répartition, RefCOCOg-umd, a été proposée plus tard par des chercheurs de l'Université du Maryland, offrant une distribution plus équilibrée des images entre les répartitions. Le choix de la répartition peut affecter considérablement l'évaluation du modèle, car différentes répartitions peuvent avoir des niveaux de difficulté variables.

Évaluation et métriques

L'évaluation standard pour RefCOCOg utilise la métrique de précision, où une prédiction est considérée comme correcte si la boîte englobante prédite a une intersection sur union (IoU) avec la boîte de vérité terrain qui dépasse un seuil, généralement 0,5. Certaines évaluations rapportent également la précision à des seuils IoU plus élevés, comme 0,75, pour évaluer la précision de localisation. La tâche est souvent formulée comme un problème de classement, où le modèle doit sélectionner la région correcte parmi un ensemble de propositions candidates générées par un détecteur d'objets.

Impact sur la recherche en IA

RefCOCOg est devenu une référence pour l'ancrage visuel et la compréhension multimodale. Il est largement utilisé pour évaluer des modèles qui combinent vision et langage, y compris ceux basés sur des architectures transformers et des grands modèles de langage. L'ensemble de données a stimulé les progrès dans des domaines tels que le sous-titrage au niveau des régions, la réponse à des questions visuelles et la génération d'expressions référentielles. De nombreuses approches modernes utilisent des techniques de apprentissage profond, y compris des architectures de base réseaux résiduels et des mécanismes de attention multi-têtes, pour relever les défis posés par les descriptions plus longues de l'ensemble de données.

L'ensemble de données sert également de fondement pour des tâches connexes, telles que la segmentation d'expressions référentielles, où l'objectif est de produire un masque au niveau des pixels plutôt qu'une boîte englobante. Les chercheurs ont étendu RefCOCOg pour créer de nouvelles références, y compris celles avec des éléments temporels ou interactifs, bien que l'ensemble de données original reste un point de référence standard.

Limites et défis

Malgré son utilité, RefCOCOg présente des limitations connues. Les descriptions, bien que plus longues que celles des ensembles de données antérieurs, sont encore relativement courtes par rapport à des paragraphes complets en langage naturel. L'ensemble de données hérite également de biais de COCO, tels qu'une surreprésentation des catégories d'objets courantes et un accent sur des scènes de la vie quotidienne. De plus, les descriptions issues du crowdsourcing peuvent être ambiguës ou reposer sur un contexte qui n'est pas toujours visuellement évident, ce qui rend la tâche difficile même pour des annotateurs humains dans certains cas.

Un autre défi est le protocole d'évaluation lui-même. L'utilisation d'un seuil IoU fixe peut ne pas capturer pleinement la qualité de la localisation d'un modèle, en particulier pour les petits objets ou ceux avec des formes irrégulières. Ces dernières années, les chercheurs ont proposé des métriques et des cadres d'évaluation plus robustes, mais la métrique de précision originale reste la plus couramment rapportée.

Directions futures

RefCOCOg continue d'être pertinent comme banc d'essai pour de nouvelles méthodes en IA. Avec l'essor de la IA générative et des modèles multimodaux, l'ensemble de données est souvent utilisé pour sonder comment ces systèmes peuvent ancrer le langage dans le contenu visuel. Les travaux futurs pourraient impliquer l'extension de l'ensemble de données avec des descriptions plus diverses, l'incorporation de vidéos ou de scènes 3D, ou son intégration avec d'autres références pour créer des suites d'évaluation plus complètes. Les leçons tirées de RefCOCOg sont susceptibles d'informer le développement de la prochaine génération d'ensembles de données d'ancrage visuel qui reflètent mieux la complexité du langage et de la vision du monde réel.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·computer-vision·natural-language-processing·visual-grounding
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique