Traduit de l'anglais

VQA 2.0 est un ensemble de données équilibré de questions-réponses visuelles introduit en 2017 pour réduire les biais linguistiques, permettant une évaluation plus robuste des modèles d'IA en vision-langage.

VQA 2.0 est un jeu de données à grande échelle pour la réponse à des questions visuelles (VQA), une tâche en intelligence artificielle où un système doit répondre à des questions en langage naturel à propos d'une image. Publié en 2017 par des chercheurs de Virginia Tech et de Microsoft Research, VQA 2.0 a été conçu pour remédier à un défaut critique de son prédécesseur, le jeu de données VQA : les modèles pouvaient souvent répondre correctement aux questions sans même regarder l'image, en exploitant des régularités statistiques dans les questions et les réponses. VQA 2.0 atténue ce problème en associant chaque question à deux images ayant des réponses différentes, forçant ainsi les modèles à comprendre véritablement le contenu visuel pour réussir. Le jeu de données est devenu une référence standard pour évaluer les modèles vision-langage, y compris ceux basés sur les transformeurs et les grands modèles de langage.

Le jeu de données VQA original, introduit en 2015, contenait plus de 200 000 images du jeu de données Microsoft COCO et plus de 600 000 questions, chacune avec plusieurs réponses de référence. Cependant, il souffrait d'un fort biais linguistique : par exemple, la question « De quelle couleur est la banane ? » avait presque toujours la réponse « jaune » dans l'ensemble d'entraînement, de sorte qu'un modèle pouvait deviner correctement sans traiter l'image. VQA 2.0, publié en 2017, a doublé le nombre de questions pour dépasser 1,1 million en ajoutant des questions complémentaires ayant des réponses différentes pour différentes images. Plus précisément, pour chaque question du jeu de données original, les créateurs ont ajouté une seconde image telle que la réponse à la même question diffère entre les deux images. Cette conception équilibrée réduit l'efficacité des raccourcis basés uniquement sur le langage et encourage le développement de modèles qui intègrent les informations visuelles et textuelles.

Composition et structure du jeu de données

VQA 2.0 se compose d'images du jeu de données Microsoft COCO, qui contient des scènes complexes avec de multiples objets et interactions. Les questions sont ouvertes et couvrent une variété de catégories, notamment la présence d'objets, la couleur, le comptage et les relations spatiales. Chaque question est accompagnée de 10 réponses de référence collectées auprès d'annotateurs humains, permettant une évaluation à l'aide d'une métrique de précision basée sur le consensus. Le jeu de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant lui-même subdivisé en test-dev et test-standard pour l'évaluation comparative. Le serveur d'évaluation officiel permet aux chercheurs de comparer leurs modèles sur les ensembles de test cachés, garantissant une comparaison équitable.

La conception équilibrée de VQA 2.0 en a fait une référence plus difficile. Par exemple, un modèle qui s'appuie sur des a priori linguistiques pourrait répondre « jaune » pour toute question sur une banane, mais VQA 2.0 inclut des images où la banane est verte ou brune, obligeant le modèle à regarder réellement l'image. Cela a conduit à des progrès significatifs dans le raisonnement visuel, car les modèles doivent apprendre à ancrer le langage dans des preuves visuelles.

Impact sur la recherche en réponse à des questions visuelles

VQA 2.0 est devenu l'un des jeux de données les plus largement utilisés dans le domaine de la réponse à des questions visuelles. Il a été utilisé pour évaluer une large gamme de modèles, des premières architectures de réseaux neuronaux aux modèles vision-langage modernes basés sur les transformeurs. Le jeu de données a également engendré plusieurs défis ultérieurs, tels que le défi de réponse à des questions visuelles, organisé chaque année lors de conférences en vision par ordinateur. De nombreux modèles de pointe, y compris ceux basés sur les architectures Transformer (architecture) et les grands modèles de langage, rapportent leurs performances sur VQA 2.0 comme métrique clé.

Un impact notable de VQA 2.0 est son rôle dans la mise en évidence de l'importance de réduire le biais dans les jeux de données d'IA. La conception équilibrée a inspiré des approches similaires dans d'autres domaines, tels que l'implication visuelle et le raisonnement visuel. Les chercheurs ont également utilisé VQA 2.0 pour étudier l'interprétabilité des modèles, en analysant les parties d'une image auxquelles un modèle prête attention lorsqu'il répond à une question.

Limites et critiques

Malgré ses améliorations, VQA 2.0 n'est pas sans limites. Certains critiques soutiennent que le jeu de données contient encore des biais, comme une tendance des questions à se concentrer sur des objets et des attributs courants. De plus, l'espace de réponses ouvert rend l'évaluation difficile, car les modèles doivent générer des réponses en texte libre comparées à un ensemble de réponses humaines. La métrique de précision, qui traite toutes les réponses de manière égale, peut ne pas capturer pleinement la qualité du raisonnement. En outre, VQA 2.0 teste principalement la reconnaissance et le raisonnement simple, et peut ne pas mesurer adéquatement les capacités cognitives de niveau supérieur telles que le bon sens ou le raisonnement abstrait.

Une autre critique est que VQA 2.0, comme de nombreuses références, peut être « contourné » par des modèles qui exploitent des schémas statistiques dans les données, même avec la conception équilibrée. Par exemple, un modèle pourrait apprendre à répondre « oui » pour les questions commençant par « Y a-t-il » à moins d'avoir des preuves solides du contraire. Pour remédier à ces problèmes, les chercheurs ont proposé des références plus difficiles, telles que VQA-CP (VQA sous a priori changeants), qui réorganise les données pour réduire davantage le biais linguistique.

Relation avec les modèles vision-langage modernes

Avec l'essor des modèles vision-langage à grande échelle, tels que ceux développés par OpenAI, Google DeepMind et Anthropic, VQA 2.0 est devenu un outil d'évaluation standard. Ces modèles, souvent basés sur des architectures de transformeurs et pré-entraînés sur de vastes paires image-texte, atteignent une haute précision sur VQA 2.0, dépassant parfois les performances humaines sur certains types de questions. Cependant, la référence reste utile pour diagnostiquer les faiblesses, comme la gestion d'objets rares ou le raisonnement spatial complexe. En 2025, VQA 2.0 continue d'être cité dans des articles sur la Generative AI et l'apprentissage multimodal, servant de pont entre la vision par ordinateur et le traitement du langage naturel.

Le jeu de données a également été intégré dans des suites d'évaluation plus larges, telles que l'OpenPanel et d'autres initiatives de référencement en IA, qui visent à évaluer les capacités des systèmes d'IA à travers plusieurs tâches. La conception équilibrée de VQA 2.0 a influencé la création de jeux de données plus récents comme GQA et CLEVR, qui se concentrent sur le raisonnement compositionnel.

Conclusion

VQA 2.0 représente une avancée significative dans l'évaluation des systèmes de réponse à des questions visuelles. En remédiant au biais linguistique inhérent aux jeux de données antérieurs, il a poussé le domaine vers des modèles plus robustes et visuellement ancrés. Son impact s'étend au-delà de la tâche spécifique, influençant la conception de jeux de données et les pratiques d'évaluation dans la recherche en IA. Alors que les modèles vision-langage continuent d'évoluer, VQA 2.0 reste une référence pertinente et difficile, garantissant que les progrès en IA sont mesurés non seulement par la reconnaissance de schémas, mais aussi par une compréhension authentique du monde visuel.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·visual-question-answering·computer-vision·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique