VQA v2 est un ensemble de données à grande échelle pour la réponse à des questions visuelles (VQA), une tâche dans laquelle un modèle doit répondre à une question en langage naturel à propos d'une image. Il a été introduit en 2017 comme successeur de l'ensemble de données VQA original, conçu pour atténuer le problème de biais linguistique qui affectait son prédécesseur. L'ensemble de données contient plus de 1,1 million de questions portant sur plus de 200 000 images, chaque question étant associée à une image complémentaire dont la réponse est différente, forçant les modèles à s'appuyer sur les informations visuelles plutôt que sur des a priori linguistiques.
La création de VQA v2 a été motivée par le constat que de nombreux modèles obtenaient de bons résultats sur VQA v1 en exploitant les régularités statistiques des questions, sans véritablement comprendre les images. Par exemple, un modèle pouvait répondre « oui » à la plupart des questions « Y a-t-il un... » indépendamment du contenu de l'image. Pour remédier à cela, l'ensemble de données VQA v2 a été construit en collectant des paires image-question complémentaires : pour chaque question, une image supplémentaire a été sélectionnée de sorte que la réponse à la même question diffère entre les deux images. Cette conception équilibrée encourage le développement de modèles qui intègrent à la fois le raisonnement visuel et textuel.
L'ensemble de données est largement utilisé comme référence dans les domaines de apprentissage automatique et de apprentissage profond, en particulier pour évaluer les architectures de réseaux de neurones et les mécanismes d'attention. Il a joué un rôle déterminant dans l'avancement de la recherche sur l'apprentissage multimodal, où les modèles doivent aligner les caractéristiques visuelles sur les représentations linguistiques. De nombreux systèmes de pointe, y compris ceux basés sur les architectures Transformer et les grands modèles de langage, ont été évalués sur VQA v2, rapportant souvent la précision comme métrique principale.
Structure de l'ensemble de données
VQA v2 comprend des images provenant de l'ensemble de données Microsoft COCO, qui inclut des scènes complexes avec de multiples objets et interactions. Chaque image est associée à plusieurs questions, et chaque question comporte 10 réponses de référence collectées auprès d'annotateurs humains. Les questions sont ouvertes et couvrent des catégories telles que la présence d'objets, la couleur, le comptage et les relations spatiales. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant lui-même subdivisé en sous-ensembles test-dev et test-standard à des fins d'évaluation.
L'innovation clé de VQA v2 réside dans son appariement équilibré : pour chaque question, il existe au moins une autre image dans l'ensemble de données où la réponse est différente. Cela garantit qu'un modèle ne peut pas atteindre une précision élevée en mémorisant simplement les schémas question-réponse. L'ensemble de données comprend environ 1,1 million de questions, avec environ 250 000 images dans l'ensemble d'entraînement, 25 000 dans l'ensemble de validation et 25 000 dans l'ensemble de test.
Métriques d'évaluation
La précision est la métrique principale utilisée pour VQA v2. Pour chaque question, la réponse prédite par un modèle est comparée aux 10 réponses fournies par des humains. La précision pour une question unique est calculée comme le minimum du nombre de réponses humaines correspondant à la prédiction divisé par 3, plafonné à 1. Ce système de notation récompense les réponses approuvées par plusieurs annotateurs, encourageant les modèles à produire des réponses de bon sens.
En plus de la précision globale, les résultats sont souvent rapportés par type de question, comme « oui/non », « nombre » et « autre » (ouverte). Cette répartition aide à identifier les forces et les faiblesses spécifiques d'un modèle. Par exemple, un modèle peut exceller dans les questions oui/non mais avoir des difficultés avec le comptage ou le raisonnement sur les relations spatiales.
Impact sur la recherche
VQA v2 est devenu une référence standard dans les communautés de vision par ordinateur et de traitement du langage naturel, bien que la liste de liens fournie n'inclue pas ces slugs. Il a stimulé le développement de nombreux modèles de apprentissage profond, notamment ceux qui utilisent des mécanismes d'attention, des réseaux résiduels et des couches d'attention multi-têtes. L'ensemble de données a également été utilisé pour étudier les techniques d'augmentation de données et les fonctions de perte adaptées aux tâches multimodales.
La conception équilibrée de VQA v2 a influencé la création d'ensembles de données ultérieurs, tels que les ensembles de données Visual Genome et GQA, qui visent également à réduire les biais. Les chercheurs ont utilisé VQA v2 pour sonder les capacités des modèles dans des domaines comme le raisonnement compositionnel et l'ancrage visuel, ce qui a permis de mieux comprendre les limites des systèmes actuels d'intelligence artificielle.
Limites et critiques
Malgré ses améliorations, VQA v2 présente encore certains biais. Par exemple, certaines questions peuvent avoir une réponse dominante dans l'ensemble de données, et les modèles peuvent exploiter ces a priori. De plus, l'ensemble de données se concentre principalement sur des images statiques de COCO, qui peuvent ne pas refléter la diversité des scénarios visuels du monde réel. Certains critiques soutiennent que la nature ouverte des questions entraîne une ambiguïté, et que la métrique d'évaluation ne tient pas compte des réponses sémantiquement équivalentes (par exemple, « voiture » vs « automobile »).
De plus, l'ensemble de données a été critiqué pour ne pas exiger de raisonnement approfondi ; de nombreuses questions peuvent être résolues en reconnaissant des objets ou des attributs sans inférence complexe. Cela a conduit au développement de références plus difficiles, telles que VQA-CP (VQA sous a priori changeants), qui réorganise les données pour exposer plus explicitement le biais linguistique.
Conclusion
VQA v2 reste une ressource fondamentale dans la recherche en IA multimodale. Sa conception équilibrée a établi une nouvelle norme pour la construction d'ensembles de données, encourageant le développement de modèles qui intègrent véritablement les informations visuelles et textuelles. Bien que de nouvelles références soient apparues, VQA v2 continue d'être utilisé pour évaluer et comparer les modèles, et son influence est évidente dans la conception des ensembles de données et des tâches ultérieurs.