Vision par ordinateur

Traduit de l'anglais

VQA (réponse à des questions visuelles) est une tâche d'apprentissage automatique où un modèle répond à des questions en langage naturel à propos d'une image, nécessitant une compréhension conjointe de la vision et du langage. C'est un banc d'essai pour les systèmes d'IA multimodaux.

La réponse à une question visuelle (VQA) est un domaine de recherche en intelligence artificielle et apprentissage automatique qui combine la vision par ordinateur et le traitement du langage naturel. La tâche consiste à fournir une image et une question libre et ouverte sur cette image, et le système doit générer une réponse correcte en langage naturel. La VQA est considérée comme un problème difficile car elle nécessite non seulement la reconnaissance d'objets et la compréhension de la scène, mais aussi le raisonnement, les connaissances de sens commun et la capacité d'ancrer le langage dans le contenu visuel. Elle sert de référence de base pour évaluer les capacités des systèmes d'IA multimodaux, en particulier ceux construits sur des architectures de apprentissage profond.

La tâche VQA a été formalisée avec la publication du jeu de données VQA en 2015 par des chercheurs de virginia-tech, Microsoft (AI) et toronto. Le jeu de données original, VQA v1, contenait plus de 200 000 images issues du jeu de données Microsoft COCO et de scènes abstraites, associées à plus de 760 000 questions et 10 millions de réponses. Chaque image avait trois questions, et chaque question avait dix réponses de vérité terrain provenant d'annotateurs humains. Le jeu de données a été conçu pour nécessiter une gamme de compétences, allant du simple comptage et de la reconnaissance des couleurs à un raisonnement plus complexe sur les relations spatiales et les activités. Une suite, VQA v2, a été publiée en 2017 pour remédier aux biais linguistiques en équilibrant les réponses pour chaque type de question, garantissant que le modèle ne puisse pas se fier uniquement aux a priori.

Architecture et Approches

Les premiers systèmes VQA utilisaient une combinaison de réseaux de neurones convolutifs (CNN) pour l'extraction de caractéristiques d'image et de réseaux de neurones récurrents (RNN) ou de réseaux à mémoire à long terme (LSTM) pour l'encodage des questions. Ces caractéristiques étaient ensuite fusionnées, souvent par multiplication élément par élément ou par concaténation, puis passées à travers un classificateur pour prédire une réponse à partir d'un vocabulaire fixe. Un modèle précoce notable était la "baseline VQA" des créateurs du jeu de données, qui utilisait une représentation de question par sac de mots et un encodeur d'image VGGNet.

Avec l'avènement de l'architecture transformeur, les modèles VQA se sont orientés vers des mécanismes basés sur l'attention. Le mécanisme de attention multi-têtes a permis aux modèles de se concentrer dynamiquement sur les régions pertinentes de l'image en fonction des mots de la question. Le cadre encodeur-décodeur est devenu standard, avec l'image et la question encodées conjointement et la réponse générée de manière autorégressive. Plus récemment, des modèles pré-entraînés à grande échelle, tels que ceux basés sur des backbones de grand modèle de langage, ont été affinés pour la VQA, en tirant parti d'un pré-entraînement cross-modal sur des paires image-texte. Ces modèles utilisent souvent des couches de attention croisée pour aligner les jetons visuels et textuels.

Jeux de Données et Références Clés

Au-delà des VQA v1 et v2 originaux, plusieurs autres jeux de données ont élargi la portée de la tâche. Le jeu de données Visual Genome, publié en 2016, a fourni des annotations denses d'objets, d'attributs et de relations, permettant une réponse à des questions plus compositionnelles. Le jeu de données GQA, introduit en 2019, s'est concentré sur le raisonnement et les questions compositionnelles, avec une répartition équilibrée pour réduire les biais. Le jeu de données CLEVR, de 2017, a utilisé des formes 3D synthétiques pour tester le raisonnement systématique, nécessitant une inférence en plusieurs étapes. Pour les applications réelles, le jeu de données VizWiz, de 2018, a collecté des questions auprès d'utilisateurs aveugles, présentant un cadre plus pratique mais plus bruité. Le jeu de données OK-VQA, publié en 2019, a mis l'accent sur les questions nécessitant des connaissances externes au-delà du contenu de l'image.

Métriques d'Évaluation

Les modèles VQA sont généralement évalués à l'aide de la précision, où une réponse prédite est considérée comme correcte si elle correspond à au moins trois des dix réponses de vérité terrain humaines. Cette métrique, connue sous le nom de précision VQA, est conçue pour gérer la subjectivité des réponses ouvertes. Pour les variantes à choix multiples, la précision standard est utilisée. Les références plus récentes rapportent également des métriques de cohérence et d'ancrage, telles que l'alignement de l'attention du modèle avec les régions pertinentes de l'image. Le classement VQA v2 a été une référence standard, bien que de nombreux modèles modernes rapportent des résultats sur une gamme de jeux de données pour démontrer la généralisation.

Défis et Limites

Un défi principal dans la VQA est le biais linguistique, où les modèles exploitent des régularités statistiques dans les données d'entraînement plutôt que de comprendre réellement l'image. Par exemple, un modèle pourrait répondre "2" à toute question de comptage sans regarder les objets. Le jeu de données VQA v2 a été spécifiquement conçu pour atténuer cela en garantissant que chaque type de question ait un ensemble équilibré de réponses. Un autre défi est la généralisation compositionnelle, où les modèles échouent sur des questions qui combinent des concepts de manières inédites. Les connaissances externes sont également difficiles à intégrer, car de nombreuses questions nécessitent un raisonnement de sens commun ou des informations factuelles absentes de l'image. Enfin, la robustesse aux perturbations adverses et aux changements de distribution reste un problème ouvert, car les modèles peuvent être facilement trompés par de petites modifications de l'image ou de la question.

Applications et Directions Futures

La VQA a des applications pratiques dans les technologies d'assistance, comme aider les utilisateurs malvoyants à comprendre leur environnement, comme le montre le projet VizWiz. Elle est également utilisée dans l'interaction homme-robot, l'imagerie médicale (par exemple, répondre à des questions sur des radiographies) et la recherche d'images par contenu. Les directions futures incluent l'amélioration des capacités de raisonnement grâce à des architectures de réseau de neurones intégrant des composants symboliques, l'intégration de modèles de IA générative pour des réponses plus détaillées et ouvertes, et le développement de meilleures métriques d'évaluation capturant l'équivalence sémantique. À partir du milieu des années 2020, les modèles de pointe exploitent souvent un pré-entraînement à grande échelle sur des données à l'échelle du web, mais ils rencontrent encore des difficultés avec le raisonnement spatial fin et la reconnaissance d'objets rares.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·natural-language-processing·multimodal-learning·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique