Traduit de l'anglais

KVQA (Knowledge-aware Visual Question Answering) est une tâche d'IA où les systèmes répondent à des questions sur des images en intégrant le contenu visuel avec des bases de connaissances externes, nécessitant un raisonnement au-delà de ce qui est visible dans l'image.

KVQA (Visual Question Answering tenant compte des connaissances) est un sous-domaine de l'intelligence artificielle et de l'apprentissage automatique qui combine la vision par ordinateur, le traitement du langage naturel et la représentation des connaissances. Contrairement à la réponse à des questions visuelles (VQA) traditionnelle, qui repose uniquement sur le contenu visuel d'une image, les systèmes KVQA doivent également accéder à des sources de connaissances externes et raisonner sur celles-ci, telles que des graphes de connaissances, des bases de données encyclopédiques ou des faits structurés, pour produire des réponses précises. Cette tâche exige que le modèle non seulement reconnaisse les objets, les scènes et les relations dans une image, mais aussi récupère des connaissances mondaines pertinentes et effectue un raisonnement en plusieurs étapes pour répondre à des questions qui peuvent faire référence à des entités, des attributs ou des faits non directement visibles dans l'image.

Le développement de la KVQA est étroitement lié aux progrès de l'apprentissage profond et à l'émergence de modèles multimodaux à grande échelle. Les premiers ensembles de données VQA, introduits au milieu des années 2010, se concentraient sur des questions auxquelles on pouvait répondre à partir de la seule image. Cependant, les chercheurs ont rapidement reconnu que de nombreuses questions naturelles, telles que « Qui a construit ce bâtiment ? » ou « Quelle est la population de cette ville ? », nécessitent des connaissances externes. Cette prise de conscience a conduit à la création de références spécifiques à la KVQA et à l'intégration de bases de connaissances dans les architectures neuronales, souvent en utilisant des modèles basés sur les transformeurs qui peuvent prêter attention à la fois aux caractéristiques visuelles et aux représentations textuelles des connaissances.

Développement historique

Le concept de KVQA est issu du programme de recherche plus large sur la VQA, qui a gagné en popularité après la publication de l'ensemble de données VQA en 2015 par des chercheurs de Virginia Tech et de Microsoft. La tâche VQA initiale était purement visuelle, mais des travaux ultérieurs, tels que l'ensemble de données FVQA (réponse à des questions visuelles basée sur des faits) introduit en 2016, exigeaient explicitement des faits externes. FVQA fournissait une base de connaissances de triplets (sujet, relation, objet) et demandait aux modèles de récupérer des faits pertinents pour répondre aux questions. Cela a été suivi par d'autres ensembles de données comme KVQA (l'homonyme, introduit en 2018 par des chercheurs de l'Institut indien de technologie de Delhi et des collaborateurs), qui se concentrait sur des questions concernant des personnes et des lieux célèbres, nécessitant des connaissances provenant de sources comme Wikipédia et Freebase.

Ces premiers ensembles de données utilisaient des bases de connaissances structurées et reposaient souvent sur des modèles de séquence à séquence ou des mécanismes d'attention pour combiner les caractéristiques d'image avec les connaissances récupérées. L'introduction de l'architecture transformeur en 2017, en particulier le mécanisme d'attention multi têtes, a permis une fusion plus sophistiquée des informations visuelles et textuelles. À la fin des années 2010, des modèles tels que LXMERT et VisualBERT, pré-entraînés sur des paires image-texte, ont commencé à incorporer des modules de connaissances, bien qu'ils aient encore du mal avec les connaissances ouvertes qui n'étaient pas présentes dans les données d'entraînement.

Défis principaux

La KVQA pose plusieurs défis uniques par rapport à la VQA standard. Premièrement, le système doit déterminer quand des connaissances externes sont nécessaires ; de nombreuses questions peuvent être résolues à partir de la seule image, et une récupération inutile de connaissances peut introduire du bruit. Deuxièmement, le processus de récupération doit être efficace et précis, nécessitant souvent que le système interroge une grande base de connaissances en temps réel. Troisièmement, l'intégration des preuves visuelles et basées sur les connaissances nécessite un raisonnement sophistiqué, car la réponse peut dépendre de la combinaison de plusieurs faits ou de la résolution de contradictions entre ce qui est vu et ce qui est connu.

Un autre défi important est le coût de l'augmentation des données et de l'annotation. La création d'ensembles de données KVQA nécessite de jumeler des images avec des questions dont les réponses ne sont pas dans l'image, ce qui exige une annotation manuelle et une curation de la base de connaissances. Cela a conduit à l'utilisation de pipelines semi-automatiques qui génèrent des questions à partir de graphes de connaissances, mais ceux-ci produisent souvent des questions simplistes ou peu naturelles. Par conséquent, de nombreux modèles KVQA sont évalués sur des domaines limités, tels que les monuments célèbres ou les célébrités, et leurs performances sur des questions ouvertes restent limitées.

Approches modernes

Avec l'essor des grands modèles de langage et des modèles multimodaux comme GPT-4V (de OpenAI) et Gemini (de Google DeepMind), la KVQA a connu un changement de paradigme. Ces modèles, souvent construits sur des architectures de transformeurs avec des milliards de paramètres, sont pré-entraînés sur des corpus massifs de textes et d'images, encodant implicitement une vaste quantité de connaissances mondaines. Par conséquent, ils peuvent souvent répondre à des questions visuelles basées sur les connaissances sans récupération explicite, en exploitant les connaissances intégrées dans leurs paramètres. Cette approche, parfois appelée KVQA « à livre fermé », a montré des résultats impressionnants sur des références comme OK-VQA (VQA à connaissances externes), introduite en 2019 et nécessitant des connaissances externes.

Cependant, les modèles à livre fermé ont des limites, notamment l'hallucination (génération de réponses plausibles mais incorrectes) et des difficultés avec des faits rares ou récents. Pour remédier à cela, des approches hybrides combinent les connaissances paramétriques avec la récupération non paramétrique, en utilisant des techniques comme l'attention croisée pour fusionner les extraits de connaissances récupérés avec les caractéristiques visuelles. Par exemple, des modèles tels que REVEAL et KAT (transformeur augmenté de connaissances) utilisent un récupérateur pour extraire des passages pertinents d'un corpus de connaissances, puis les transmettent à un générateur basé sur un transformeur. Ces systèmes emploient souvent la recherche en faisceau ou l'échantillonnage top p lors du décodage pour produire des réponses.

L'intégration des plongements de graphes de connaissances a également été explorée, où le modèle apprend à raisonner sur des structures de graphe. Par exemple, certains travaux utilisent des réseaux neuronaux de graphes pour propager des informations à partir d'entités récupérées, permettant un raisonnement multi-sauts. Ces méthodes sont particulièrement utiles pour les questions qui nécessitent de combiner plusieurs faits, comme « Qui est le réalisateur du film mettant en scène cet acteur ? »

Évaluation et références

Les références standard pour la KVQA incluent FVQA, KVQA et OK-VQA. FVQA (2016) contient environ 2 000 questions avec une base de connaissances de 50 000 faits. KVQA (2018) compte plus de 18 000 questions sur 1 800 personnes et monuments célèbres, avec des réponses provenant de Freebase. OK-VQA (2019) est plus grand, avec plus de 14 000 questions nécessitant des connaissances externes, mais il ne fournit pas de base de connaissances spécifique, ce qui le rend plus difficile. Des références plus récentes, comme A-OKVQA (2022), étendent cela avec des questions à choix multiples et ouvertes, et incluent une base de connaissances de légendes d'images et de faits externes.

Les métriques d'évaluation incluent généralement la précision (correspondance exacte ou exactitude des choix multiples) et, pour les modèles génératifs, des métriques comme CIDEr ou BLEU. Cependant, ces métriques échouent souvent à capturer la qualité du raisonnement, et il existe un débat en cours sur la question de savoir si les modèles raisonnent réellement ou mémorisent simplement des schémas. Certains chercheurs ont proposé des ensembles de données de diagnostic qui testent des capacités de raisonnement spécifiques, telles que des questions compositionnelles ou des exemples contradictoires nécessitant des connaissances hors de la distribution d'entraînement.

Applications et orientations futures

La KVQA a des applications pratiques dans des domaines tels que la technologie d'assistance (aider les utilisateurs malvoyants à comprendre leur environnement), l'éducation (répondre à des questions sur des images historiques ou des diagrammes scientifiques) et le commerce électronique (fournir des informations sur les produits basées sur des images). Dans le domaine médical, la KVQA pourrait aider les radiologues en répondant à des questions sur des scans nécessitant des connaissances en anatomie ou en maladies, bien que cela reste un domaine de recherche actif.

Les orientations futures incluent l'amélioration de la fiabilité de la récupération des connaissances, la réduction de l'hallucination dans les modèles génératifs et le développement de références qui reflètent mieux la complexité du monde réel. Il existe également un intérêt pour rendre les modèles KVQA plus interprétables, permettant aux utilisateurs de voir quels faits ont été utilisés pour dériver une réponse. Alors que l'IA générative continue de progresser, la KVQA est susceptible de devenir un composant standard des assistants multimodaux, leur permettant de répondre à une large gamme de questions visuelles avec des connaissances mondaines.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·computer-vision·natural-language-processing·knowledge-representation
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique