La réponse à une question visuelle (VQA) est une tâche d'intelligence artificielle qui exige qu'un système réponde à des questions en langage naturel à propos d'une image. Elle se situe à l'intersection de la vision par ordinateur et du traitement du langage naturel, exigeant que le modèle non seulement reconnaisse les objets, les scènes et les activités dans une image, mais aussi comprenne la sémantique de la question et raisonne sur le contenu visuel pour produire une réponse correcte. La VQA est considérée comme une référence pour la compréhension et le raisonnement visuels de haut niveau, allant au-delà de la simple classification d'images ou du sous-titrage.
La tâche implique généralement une image d'entrée et une question sous forme de texte libre, la sortie attendue étant une réponse concise, souvent un mot unique ou une phrase courte. Les systèmes de VQA doivent gérer une large gamme de types de questions, y compris celles sur la présence d'objets, la couleur, le nombre, les relations spatiales, et même le raisonnement de bon sens qui va au-delà de ce qui est directement visible. Le domaine a gagné un essor significatif au milieu des années 2010 avec la publication de jeux de données à grande échelle et l'application de techniques d'apprentissage profond, et il est depuis devenu une évaluation standard pour les modèles d'IA multimodaux.
Jeux de données et références
Le jeu de données VQA, publié pour la première fois en 2015 par des chercheurs de Virginia Tech et de Microsoft, est devenu la référence de facto pour la tâche. Le jeu de données VQA original contenait plus de 200 000 images du jeu de données Microsoft COCO et plus de 600 000 questions, chaque question étant associée à plusieurs réponses de vérité terrain collectées auprès d'annotateurs humains. Le jeu de données a été conçu pour nécessiter une gamme de compétences, notamment la reconnaissance d'objets, le comptage et le raisonnement spatial. Les versions ultérieures, comme VQA 2.0, ont équilibré la distribution des réponses pour réduire les biais linguistiques, où les modèles pouvaient deviner les réponses en se basant uniquement sur les schémas de questions sans regarder l'image. D'autres références notables incluent Visual Genome, qui fournit des annotations denses d'objets, d'attributs et de relations, et CLEVR, un jeu de données synthétique conçu pour tester le raisonnement compositionnel en générant des images de formes 3D simples et en posant des questions nécessitant une logique en plusieurs étapes.
Approches et architectures
Les premiers systèmes de VQA utilisaient une combinaison de réseaux de neurones convolutifs (CNN) pour l'extraction de caractéristiques d'image et de réseaux de neurones récurrents (RNN) ou de réseaux à mémoire à long terme (LSTM) pour l'encodage des questions. Ces caractéristiques étaient ensuite fusionnées, souvent par multiplication élément par élément ou concaténation, puis passées à travers un classifieur pour prédire la réponse. Une percée majeure est venue avec l'introduction des mécanismes d'attention, qui permettaient au modèle de se concentrer sur les régions pertinentes de l'image en fonction de la question. L'architecture Transformer, introduite en 2017, a encore révolutionné le domaine en permettant un traitement unifié des jetons visuels et textuels. Les modèles modernes de VQA, tels que ceux basés sur le pré-entraînement vision-langage, utilisent des modèles de type transformer à grande échelle pré-entraînés sur des paires image-texte puis affinés sur des jeux de données VQA. Ces modèles, souvent intégrés à des grands modèles de langage, peuvent générer des réponses en texte libre et effectuer un raisonnement complexe, parfois même sans affinage explicite sur les données VQA.
Défis et limites
Malgré des progrès significatifs, la VQA reste une tâche difficile. Un problème majeur est le biais linguistique : les modèles peuvent exploiter les régularités statistiques des données d'entraînement pour répondre aux questions sans vraiment comprendre l'image. Par exemple, un modèle pourrait répondre « 2 » aux questions commençant par « Combien » parce que c'est la réponse la plus courante dans le jeu de données. Le jeu de données VQA 2.0 a été créé pour atténuer ce problème en garantissant que chaque question a des images complémentaires avec des réponses différentes. Un autre défi est la généralisation compositionnelle, où les modèles ont du mal à répondre à des questions nécessitant des combinaisons nouvelles de concepts connus. De plus, les systèmes de VQA échouent souvent sur des questions nécessitant des connaissances externes ou un raisonnement de bon sens, comme « Pourquoi la personne sourit-elle ? » ou « Que va-t-il se passer ensuite ? ». La robustesse aux exemples adverses et aux images hors distribution est également une préoccupation, car les modèles peuvent être facilement trompés par de légères perturbations.
Applications
La VQA a des applications pratiques dans divers domaines. En accessibilité, elle peut aider les personnes malvoyantes en répondant à des questions sur leur environnement, comme lire des panneaux ou identifier des objets. En interaction homme-machine, la VQA permet des interfaces plus naturelles où les utilisateurs peuvent poser des questions sur des images dans des systèmes de chat ou de recherche. Dans le domaine de la santé, la VQA peut aider les radiologues en répondant à des questions sur des images médicales, bien que cela nécessite une formation spécialisée et une validation minutieuse. Dans le commerce électronique, la VQA peut alimenter la recherche visuelle et les systèmes de recommandation de produits. La technologie est également utilisée dans la conduite autonome, où les systèmes doivent comprendre et raisonner sur des scènes visuelles pour répondre à des questions comme « Le feu de circulation est-il rouge ? » ou « Y a-t-il un piéton qui traverse ? »
Développements récents
L'essor des grands modèles multimodaux, tels que ceux développés par OpenAI, Google DeepMind et d'autres laboratoires de recherche, a considérablement fait progresser les capacités de VQA. Ces modèles, souvent construits sur des architectures de type transformer et entraînés sur des ensembles massifs d'images et de textes, peuvent répondre aux questions avec une grande précision et même fournir des explications. Par exemple, des modèles comme GPT-4V et Gemini ont démontré de bonnes performances sur les références VQA standard, approchant parfois la précision humaine sur certaines tâches. Cependant, ces modèles ne sont pas sans limites, et ils peuvent encore présenter des biais ou des hallucinations. Le domaine continue d'évoluer, avec des recherches axées sur l'amélioration des capacités de raisonnement, la réduction des biais et la rendue des modèles plus interprétables et robustes. En 2025, la VQA reste un domaine de recherche actif, avec de nouvelles références et de nouveaux défis introduits pour repousser les limites de la compréhension visuelle.