Traduit de l'anglais

VQA 1.0 est le jeu de données et benchmark original de réponse à des questions visuelles, introduit en 2015 pour évaluer la capacité des systèmes d'IA à répondre à des questions en langage naturel sur des images.

VQA 1.0 est le premier jeu de données et banc d'essai à grande échelle pour la réponse à des questions visuelles (VQA), une tâche qui exige qu'un système d'IA réponde à des questions ouvertes sur des images. Introduit en 2015 par des chercheurs de Virginia Tech et de Microsoft, il est devenu l'ensemble d'évaluation standard du domaine, stimulant les progrès dans la combinaison de la vision par ordinateur et du traitement du langage naturel. L'ensemble de données comprend des photographies réelles avec des questions et des réponses annotées par des humains, conçues pour tester la capacité d'un modèle à raisonner sur le contenu visuel et le langage.

La création de VQA 1.0 a été motivée par l'objectif de développer des systèmes d'IA capables d'interagir avec le monde visuel de manière proche de l'humain. Contrairement aux tâches antérieures telles que le légendage d'images, qui génère une seule phrase descriptive, VQA exige de répondre à des questions spécifiques, ce qui demande une compréhension et un raisonnement plus profonds. La conception de l'ensemble de données encourage les modèles à traiter une variété de types de questions, notamment les questions fermées, les dénombrements et les requêtes ouvertes, et à fonder leurs réponses sur des preuves visuelles.

Structure de l'ensemble de données et statistiques

VQA 1.0 est composé de 204 721 images provenant de l'ensemble de données Microsoft COCO, accompagnées de 614 163 questions et de 6 141 630 réponses. Chaque image est associée à environ trois questions, et chaque question dispose de dix réponses de référence fournies par différents annotateurs humains. Les questions sont les domaines généraux, couvrant des catégories telles que les objets, les couleurs, le comptage et les relations spatiales. L'ensemble de données est divisé en ensembles d'entraînement (82 783 images), de validation (40 504 images) et de test (81 434 images), l'ensemble de test étant lui-même divisé en test-dev et test-standard pour l'évaluation.

Définition de la tâche et évaluation

Dans VQA, un modèle reçoit une image et une question en langage naturel, et doit produire une réponse concise. La métrique d'évaluation est la précision, calculée en comparant la réponse du modèle aux dix réponses humaines. La réponse d'un modèle est considérée comme correcte si correspondance exacte. Cette métrique, connue sous le nom de précision VQA. Le banc d'essai fournit également des répartitions par type de question, permettant aux chercheurs d'analyser les fréquences sur des catégories spécifiques telles que « quelle couleur » ou « combien ».

Modèles de base et premiers progrès

Les premiers modèles de référence pour VQA 1.0 incluaient des solutions inédites comme la recherche en plus proche voisin et un modèle « précédent » qui prédit toujours la réponse la plus courante pour un type de question donné. Ces modèles de base ont obtenu des précisions d'environ 30 à 40 %. Les premiers modèles neuronaux, qui combinaient des récurrents convolutionnels pour les caractéristiques d'image avec des réseaux de neurones récurrents pour le codage des questions, ont amélioré les performances à environ 55 à 60 %. Ces systèmes précoces utilisaient des réseaux LSTM et des plongements de mots pour traiter les questions, et extrayaient les caractéristiques d'image d'un réseau VGG modèle pré-entraîné.L'écart entre la performance humaine (environ 83 %) et celle de la machine souligne la difficulté de la tâche.

Impact et héritage

VQA 1.0 a établi la tâche VQA comme un défi central dans le domaine de l'intelligence artificielle, ce qui a déjà déclenché le développement de nombreux ensembles de données et modèles de suivi. Il a conduit à la création de VQA 2.0, qui pondère la distribution des réponses pour réduire les biais linguistiques, et de Visual Genome, qui ajoutait des annotations occasionnelles au niveau des régions. L'ensemble de données qui a analysé la conception de bancs d'essai ultérieurs comme GQA et CLEVR, qui se concentrent sur le raisonnement compositionnelle. VQA 1.0 reste un point de référence pour évaluer les composantes du raisonnement visuel, et sa méthode a été adoptée dans de nombreux bancs d'essai multimodaux ultérieurs.

La publication de VQA 1.0 a été faite en parallèle de l'essor de l'apprentissage profond et de l'architecture de transformeur, devenue donc aussi dominante dans les modèles multimodaux. Les systèmes actuels, comme ceux basés sur grand modèle de langage avec des encodeurs visuelsvisuels, atteignent désormais une performance presque -humaine sur VQA 1.0, mais l'héritage du jeu de données réside dans son rôle de catalyseur pour la recherche sur le raisonnement visuel et la compréhension du langage ancré.

Mais aussi voir

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·computer-vision·natural-language-processing·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique