Traduit de l'anglais

ReferIt est un ensemble de données pour l'ancrage d'expressions référentielles, contenant des images avec des phrases en langage naturel associées et des annotations de régions correspondantes. Il permet la recherche en ancrage visuel et en interaction homme-machine.

ReferIt est un jeu de données destiné à l'ancrage d'expressions référentielles, une tâche qui relie des descriptions en langage naturel à des régions spécifiques dans des images. Il a été introduit pour faciliter la recherche dans des domaines tels que l'ancrage visuel, l'interaction homme-robot et le raisonnement multimodal. Le jeu de données associe des images à des expressions référentielles en langage naturel et fournit des annotations de boîtes englobantes qui spécifient la région cible correspondant à chaque expression.

Le jeu de données comprend près de 20 000 images et plus de 130 000 expressions référentielles. Les images sont collectées à partir d'ImageNet, et les expressions ont été rassemblées grâce à un jeu collaboratif homme-machine, ce qui a garanti que le langage utilisé était naturel et orienté vers la tâche, reflétant des scénarios d'interaction réels. Chaque expression dans ReferIt est associée à une annotation de segmentation ou de boîte englobante qui marque la région de vérité terrain à laquelle la phrase fait référence.

Définition de la tâche

Dans la tâche d'ancrage d'expressions référentielles, un modèle reçoit une image et une expression référentielle, telle que « la tasse rouge sur la table ». L'objectif est de produire une région dans l'image qui correspond à la description. Cette tâche diffère de la détection d'objets standard, car l'expression peut décrire tout objet ou région reconnaissable par les humains, et il n'existe pas d'ensemble prédéfini de catégories d'objets. L'évaluation de la performance d'un modèle sur ReferIt implique généralement la mesure de l'intersection sur union (IoU) entre la région prédite et l'annotation de vérité terrain, avec un seuil courant de IoU supérieur à 0,5 considéré comme une localisation correcte.

Construction du jeu de données

La construction de ReferIt a impliqué deux composantes principales. Premièrement, un ensemble d'images a été collecté à partir de la base de données ImageNet, garantissant une diversité de scènes et d'objets quotidiens. Deuxièmement, les expressions référentielles ont été générées à travers un jeu de type Pictionary, où un joueur décrivait un objet et un autre joueur devait l'identifier. Ce processus a permis de collecter des phrases naturelles, variées et parfois ambiguës. Les images ont ensuite été annotées avec des masques de segmentation, qui ont été convertis en boîtes englobantes à des fins d'évaluation, bien que certaines variantes du jeu de données conservent les annotations de masque pour les tâches de segmentation.

Architectures de modèles et méthodes

La plupart des approches modernes de l'ancrage d'expressions référentielles sur ReferIt impliquent des modèles d'apprentissage profond, en particulier ceux basés sur l'intelligence artificielle et le apprentissage automatique. Le pipeline standard utilise un réseau de neurones qui encode à la fois la modalité visuelle et textuelle. Typiquement, un réseau convolutif pré-entraîné tel que le réseau résiduel est utilisé pour l'extraction de caractéristiques d'image, et un transformeur ou un réseau récurrent encode le texte. Ces représentations sont ensuite fusionnées, et un module de localisation prédit la boîte englobante ou le masque.

De nombreux modèles utilisent une approche en deux étapes où des propositions de régions sont d'abord générées par un détecteur d'objets, puis mises en correspondance avec l'expression de requête. Alternativement, des améliorations récentes utilisent un cadre entièrement différentiable qui prédit directement les coordonnées à partir des caractéristiques fusionnées, souvent avec des mécanismes de attention multi-têtes. En 2024, les résultats de pointe sur ReferIt ont été rapportés en utilisant des transformeurs vision-langage pré-entraînés à grande échelle, qui exploitent de vastes quantités de données et un affinage ultérieur sur le jeu de données.

Applications

ReferIt fournit une référence pour évaluer les modèles qui doivent ancrer le langage dans un monde visuel, ce qui est essentiel pour des tâches telles que l'interaction homme-robot, l'édition d'images interactive et la réalité augmentée. Il a également été utilisé comme source d'entraînement pour des systèmes qui combinent la vision par ordinateur et le traitement du langage naturel, y compris des assistants multimodaux intégrés. Le jeu de données a engendré des tâches connexes, notamment la résolution de coréférence visuelle et la génération d'expressions référentielles, où les modèles produisent un langage décrivant une région donnée.

Impact et limites

ReferIt a été largement adopté par la communauté de recherche, devenant l'une des références standard, aux côtés de jeux de données similaires. Ses principales limites incluent le nombre relativement faible d'images par rapport aux jeux de données visuels modernes à grande échelle, et son biais vers les scènes naturelles, qui peut ne pas se généraliser à des domaines d'images extrêmement spécialisés ou industriels. Cependant, son réalisme et sa structure de langage naturel continuent de stimuler le développement d'algorithmes d'ancrage. Il sert également de base pour évaluer le vocabulaire hors ensemble et la généralisation, car les expressions peuvent être arbitrairement complexes.

Ressources connexes

Le domaine de l'ancrage d'expressions a évolué en une sous-discipline de l'apprentissage multimodal, et les principes de ReferIt ont été intégrés dans des jeux de données et des références plus complets. Ceux-ci incluent désormais des jeux de données d'ancrage vidéo et des tâches combinées, reliant le langage à des objets dans des images et des événements temporels. L'apprentissage par renforcement à partir de retours humains a également été exploré dans ces contextes pour améliorer la précision de l'ancrage, comme décrit dans RLHF. Les concepts fondamentaux de fusion du visuel et du langage sont également centraux pour les architectures plus récentes comme l'encodeur-décodeur des grands modèles de langage et les mécanismes de attention croisée.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·natural-language-processing·dataset·grounding
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique