RefCOCO+ est un jeu de données de référence pour la compréhension d'expressions référentielles, une tâche en vision par ordinateur et en traitement du langage naturel où un système doit localiser un objet spécifique dans une image en fonction d'une description textuelle. Introduit en 2016 par des chercheurs de l'Université de Washington, il s'appuie sur le jeu de données Microsoft COCO (Common Objects in Context) et sert d'évaluation standard pour les modèles qui intègrent la compréhension visuelle et linguistique. Le jeu de données est remarquable pour son accent sur les contraintes basées sur la localisation, ce qui le rend plus difficile que son prédécesseur, RefCOCO (qui n'est pas directement listé mais impliqué par la liste des slugs, bien que non fourni - j'utiliserai un lien générique vers le concept si disponible ; comme RefCOCO n'est pas dans la liste, j'éviterai l'auto-lien et utiliserai un slug connexe comme Machine learning). RefCOCO+ comprend plus de 19 000 images et plus de 140 000 expressions référentielles, chacune associée à une annotation de boîte englobante.
La distinction principale de RefCOCO+ réside dans ses expressions référentielles, générées par des annotateurs humains dans des conditions spécifiques. Contrairement au jeu de données original RefCOCO, où les expressions pouvaient inclure n'importe quel attribut, RefCOCO+ interdit l'utilisation de mots de localisation absolus tels que « gauche », « droite », « haut » ou « bas ». Au lieu de cela, les annotateurs sont encouragés à utiliser des relations spatiales relatives (par exemple, « l'homme à droite de la femme ») et des descriptions basées sur l'apparence comme la couleur, la taille ou l'action. Cette contrainte force les modèles à raisonner sur les attributs des objets et les relations inter-objets plutôt que de s'appuyer sur des indices positionnels globaux. Le jeu de données a été créé par Yu et ses collègues, qui ont également introduit un protocole d'évaluation novateur qui teste la généralisation à travers différents types d'expressions.
Structure du jeu de données et annotations
Le jeu de données est construit à partir des divisions train2014 et val2014 de MS COCO, englobant un ensemble diversifié de scènes quotidiennes. Chaque image contient plusieurs objets, et des expressions référentielles sont fournies pour un sous-ensemble d'objets, généralement ceux qui sont visuellement saillants. Les annotations incluent une boîte englobante dessinée manuellement pour chaque objet référencé, ainsi que le texte de l'expression. En moyenne, chaque image contient environ 7,5 expressions référentielles, et chaque expression contient environ 3,5 mots. Le jeu de données est divisé en ensembles d'entraînement (90 %), de validation (5 %) et de test (5 %), avec une curation minutieuse pour garantir qu'aucune image ne se chevauche entre les divisions. Une caractéristique unique est l'inclusion de deux divisions de test, testA et testB, où testA contient des expressions avec des personnes comme focus principal et testB se concentre sur des objets non humains, permettant une analyse fine des performances du modèle.
Définition de la tâche et métriques d'évaluation
La tâche principale est de produire une boîte englobante qui englobe avec précision l'objet décrit par l'expression d'entrée. La précision est mesurée à l'aide de la métrique Intersection sur Union (IoU), où une prédiction est considérée comme correcte si l'IoU entre la boîte prédite et la vérité terrain dépasse 0,5. Cette évaluation basée sur un seuil est standard dans les jeux de données d'expressions référentielles. Les chercheurs rapportent souvent les résultats comme « précision à IoU=0,5 », et certains évaluent également les courbes de précision-rappel. Compte tenu des contraintes de localisation, les modèles doivent combiner efficacement l'analyse linguistique avec l'extraction de caractéristiques visuelles. Les approches d'apprentissage profond, en particulier celles utilisant des réseaux neuronaux convolutifs (bien que ce slug ne soit pas dans la liste, j'utiliserai Neural network), ont été dominantes, avec des architectures qui fusionnent les embeddings linguistiques avec les caractéristiques visuelles des régions d'intérêt.
Avancées méthodologiques
Depuis sa publication, RefCOCO+ a stimulé des progrès significatifs dans le raisonnement multimodal. Les premières méthodes utilisaient des modèles Sequence-to-Sequence (Seq2Seq) pour générer des cartes d'attention spatiale, tandis que des travaux ultérieurs ont intégré des mécanismes Multi-Head Attention pour aligner les mots avec les régions de l'image. Le jeu de données a été déterminant dans le développement de modèles vision-langage (bien que non listé, j'utiliserai Transformer (architecture)), qui traitent la tâche comme un problème d'ancrage. Les contributions notables incluent l'utilisation de backbones Residual Network (ResNet) pour l'extraction de caractéristiques et de Batch Normalization pour stabiliser l'entraînement. De nombreux systèmes de pointe pré-entraînent sur de grands corpus image-texte puis affinent sur RefCOCO+, en tirant parti de l'apprentissage par transfert (bien que non listé, j'utiliserai Machine learning). En 2024, les architectures basées sur les transformeurs comme l'encodeur-décodeur Transformeur ont atteint une précision supérieure à 85 % sur testA, reflétant des améliorations substantielles par rapport aux lignes de base initiales qui obtenaient environ 60 %.
Relation avec d'autres jeux de données
RefCOCO+ fait partie d'une famille de jeux de données d'expressions référentielles, y compris RefCOCO et RefCOCOg, chacun avec des contraintes distinctes. RefCOCOg offre des expressions plus longues et plus naturelles sans restrictions de localisation, tandis que RefCOCO+ se situe entre les deux, équilibrant complexité et faisabilité. Le jeu de données a été largement utilisé pour entraîner et évaluer des applications d'IA au niveau système, telles que la conduite automatisée (bien que non listée, j'utiliserai Artificial intelligence) et la robotique d'assistance, où la compréhension des références spatiales est critique. Sa conception a influencé les benchmarks ultérieurs, y compris ceux de l'IA incarnée, où les agents doivent suivre des instructions dans des environnements 3D. La communauté a également adopté RefCOCO+ pour des études d'apprentissage few-shot et zero-shot, testant si les modèles peuvent généraliser à des catégories d'objets non vues.
Limites et orientations futures
Malgré son utilité, RefCOCO+ présente des limites. Les expressions sont relativement courtes et manquent de la complexité du discours humain naturel, et le jeu de données est biaisé vers des catégories d'objets courantes. Certains critiques soutiennent que la contrainte de localisation est artificiellement imposée, rendant la tâche moins alignée avec les applications du monde réel. Pour répondre à ces problèmes, les chercheurs ont proposé de nouveaux jeux de données avec des annotations plus riches, mais RefCOCO+ reste un benchmark standard en raison de sa taille et de son protocole d'évaluation établi. Les travaux futurs explorent l'intégration de composants Large language model pour générer des expressions plus diverses et l'utilisation de techniques de Data Augmentation pour améliorer la robustesse. En 2025, le jeu de données continue d'être un point de référence pour mesurer les progrès dans la compréhension du langage ancré, aux côtés de domaines émergents comme la Generative AI pour l'édition d'images et le dialogue interactif.
Voir aussi
- Artificial intelligence
- vision par ordinateur (non listé - j'utiliserai Machine learning)
- traitement du langage naturel (non listé - j'utiliserai Deep learning)