Traduit de l'anglais

Visual Genome est un ensemble de données à grande échelle d'images densément annotées, reliant le contenu visuel à des descriptions textuelles structurées pour la recherche en IA. Il fournit des descriptions de régions, des objets, des attributs et des relations pour soutenir des tâches en vision par ordinateur et en traitement du langage naturel.

Visual Genome est un ensemble de données à grande échelle conçu pour relier la compréhension visuelle au langage naturel. Il contient plus de 108 000 images, chacune annotée avec un ensemble dense de descriptions de régions, d'objets, d'attributs et de relations. Cet ensemble de données a été créé pour permettre aux modèles d'apprentissage automatique de raisonner sur les interactions complexes entre les objets d'une image, allant au-delà de la simple reconnaissance d'objets vers une compréhension plus complète de la scène. Il a été introduit en 2016 par des chercheurs de l'Université Stanford et de l'Université de Toronto, notamment Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein et Li Fei-Fei.

L'objectif principal de Visual Genome est de fournir une ressource qui soutient le développement de systèmes d'intelligence artificielle capables de répondre à des questions sur les images, de générer des légendes descriptives et d'effectuer un raisonnement visuel. Contrairement aux ensembles de données qui se concentrent sur la classification d'objets uniques ou la légende simple, Visual Genome offre une représentation structurée du contenu d'une image. Chaque image est annotée avec une moyenne de 35 objets, 26 attributs et 21 relations par paires entre objets. Ces annotations sont organisées en un graphe de scène, un graphe dirigé où les nœuds représentent les objets et les arêtes représentent des relations telles que « monter », « porter » ou « à côté de ». Cette structure permet aux algorithmes de décomposer une image en une représentation sémantique qui peut être interrogée et manipulée.

Structure de l'ensemble de données et processus d'annotation

L'ensemble de données comprend plusieurs composants clés : descriptions de régions, objets, attributs, relations et paires question-réponse. Les descriptions de régions sont de courtes phrases en langage naturel qui décrivent une zone spécifique d'une image. Les objets sont des boîtes englobantes étiquetées avec des noms correspondants, tandis que les attributs décrivent des propriétés comme la couleur, la taille ou la forme. Les relations connectent deux objets avec un prédicat, comme « homme tenant une planche de surf ». De plus, Visual Genome comprend plus de 1,7 million de paires question-réponse, utilisées pour entraîner les systèmes de réponse à des questions visuelles. Le processus d'annotation a impliqué des travailleurs crowdsourcés qui ont reçu des instructions détaillées pour garantir la cohérence. Chaque image a été annotée par plusieurs travailleurs, et les résultats ont été agrégés et filtrés pour maintenir la qualité. L'ensemble de données comprend également un ensemble de 80 000 images avec des graphes de régions plus densément connectés, fournissant une source plus riche pour entraîner des modèles complexes.

Applications en apprentissage automatique

Visual Genome est devenu une référence standard pour les tâches en vision par ordinateur et en apprentissage automatique. Il est largement utilisé pour entraîner et évaluer des modèles sur la génération de graphes de scène, où l'objectif est de prédire les objets et leurs relations à partir d'une image. Il soutient également la réponse à des questions visuelles, la génération de légendes d'images et la compréhension d'expressions référentielles, où un modèle doit localiser un objet décrit par une phrase en langage naturel. Les annotations structurées de l'ensemble de données ont été essentielles pour faire progresser la recherche sur les architectures de réseaux de neurones qui combinent des informations visuelles et textuelles, comme les modèles basés sur transformeurs. Par exemple, des modèles comme le Visual Transformer et divers systèmes de vision guidés par grands modèles de langage ont été entraînés sur Visual Genome pour améliorer leur capacité à ancrer le langage dans le contenu visuel. Les chercheurs ont également utilisé l'ensemble de données pour étudier la généralisation compositionnelle, où les modèles doivent comprendre des combinaisons nouvelles d'objets et de relations connus.

Impact et limites

Depuis sa publication, Visual Genome a influencé la conception d'ensembles de données ultérieurs, comme l'ensemble de données Open Images et les annotations étendues de l'ensemble de données COCO. Il a également été utilisé en conjonction avec d'autres ressources pour créer des références plus complètes pour l'IA incarnée et la robotique, où les agents doivent interpréter des scènes visuelles pour agir dans le monde. Cependant, l'ensemble de données présente des limites connues. Les annotations sont biaisées vers les objets courants et les scènes quotidiennes, ce qui peut conduire à des modèles qui performent mal sur des objets rares ou inhabituels. La nature crowdsourcée des annotations introduit du bruit, et certaines relations peuvent être ambiguës ou étiquetées de manière incohérente. De plus, l'ensemble de données est statique et ne reflète pas la diversité des environnements réels, comme les espaces intérieurs avec de nombreux objets occlus ou les scènes extérieures avec des conditions d'éclairage variables. Les chercheurs ont abordé ces problèmes en développant des méthodes pour nettoyer les données ou en les combinant avec des données synthétiques issues de simulations.

Relation avec d'autres ressources en IA

Visual Genome fait partie d'un écosystème plus large d'ensembles de données et de modèles qui ont stimulé les progrès en apprentissage profond. Il complète des ensembles de données comme ImageNet, qui se concentre sur la classification d'objets, et MS COCO, qui fournit une segmentation d'instances et des légendes. La représentation en graphe de scène introduite par Visual Genome a été adoptée par d'autres projets, comme le Scene Graph Benchmark et l'ensemble de données GQA, qui se concentre sur le raisonnement visuel avec des questions plus complexes. Dans le contexte de l'IA moderne, Visual Genome a été utilisé pour pré-entraîner des modèles vision-langage, qui sont ensuite affinés pour des tâches spécifiques. Ces modèles, souvent construits sur des architectures transformeurs, ont été développés par des organisations telles que Google DeepMind, OpenAI et Anthropic, bien que Visual Genome lui-même soit une ressource académique plutôt qu'un produit commercial. L'ensemble de données est librement disponible à des fins de recherche et est hébergé sur un site Web dédié, avec des outils pour télécharger et visualiser les annotations.

Directions futures

Au milieu des années 2020, le domaine s'est orienté vers des ensembles de données plus vastes et plus diversifiés ainsi que des modèles multimodaux capables de gérer la vidéo, l'audio et le texte en plus des images. Visual Genome reste une ressource précieuse pour comprendre les principes de l'annotation dense et de la construction de graphes de scène. Les chercheurs continuent de l'utiliser pour développer de nouveaux algorithmes pour l'apprentissage en quelques exemples, où les modèles doivent généraliser à partir d'un petit nombre d'exemples, et pour le raisonnement zéro-shot, où les modèles gèrent des catégories non vues. L'accent mis par l'ensemble de données sur les relations et les attributs a également inspiré des travaux sur le raisonnement causal en vision, où les modèles doivent déduire non seulement ce qui est présent mais pourquoi certains objets interagissent. Bien que les ensembles de données plus récents puissent offrir plus d'échelle ou de diversité, les annotations détaillées de Visual Genome fournissent une base unique pour étudier la nature compositionnelle des scènes visuelles, un défi qui reste central pour atteindre une intelligence visuelle de niveau humain.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·scene-graph·visual-reasoning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique