MMQA (Multimodal Question Answering) est un ensemble de données de référence conçu pour évaluer la capacité des systèmes d'intelligence artificielle à répondre à des questions nécessitant un raisonnement sur plusieurs types de données, notamment le texte, les images, les tableaux et les vidéos. Introduit par des chercheurs de Facebook AI Research (désormais intégré à Meta AI) en 2019, cet ensemble de données comble une lacune des références antérieures en matière de réponse à des questions, qui se concentraient sur une seule modalité, comme des entrées uniquement textuelles ou uniquement visuelles. MMQA fournit un ensemble diversifié de questions et de réponses correspondantes qui exigent l'intégration d'informations provenant de sources différentes, repoussant les limites des modèles de apprentissage automatique et de apprentissage profond vers une compréhension plus proche de celle des humains.
L'ensemble de données a été créé pour soutenir le développement de modèles capables de traiter des requêtes du monde réel où l'information est dispersée dans divers formats. Contrairement aux ensembles de données traditionnels qui supposent une source unique de vérité, MMQA exige des systèmes qu'ils localisent, combinent et raisonnent sur des preuves provenant de multiples modalités simultanément. Cela en fait un banc d'essai difficile pour les architectures de réseaux neuronaux, en particulier celles basées sur le modèle transformeur, qui sont devenues l'approche dominante en traitement du langage naturel et en compréhension multimodale.
Construction et composition
MMQA a été construit en collectant des questions auprès de travailleurs en ligne à qui l'on montrait un ensemble d'articles Wikipédia, chacun contenant du texte, des images, des tableaux et, dans certains cas, des vidéos. Les travailleurs devaient générer des questions qui ne pouvaient être résolues qu'en combinant des informations provenant d'au moins deux modalités différentes. Par exemple, une question pourrait nécessiter la lecture d'un tableau de statistiques et l'examen d'une image pour en déduire une relation, ou le visionnage d'un clip vidéo et la lecture d'un passage de texte pour répondre à une requête factuelle.
L'ensemble de données final comprend plus de 12 000 paires question-réponse, chaque question étant liée à une page Wikipédia spécifique. Les réponses sont de courts extraits de texte, généralement de quelques mots, extraits du contenu source. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant utilisé pour l'évaluation officielle. Les questions sont conçues pour être complexes et nécessitent souvent un raisonnement en plusieurs étapes, ce qui rend l'ensemble de données nettement plus difficile que les références à modalité unique comme SQuAD ou VQA.
Évaluation et métriques
Les modèles sont évalués sur MMQA à l'aide de métriques standard de réponse aux questions, principalement la correspondance exacte (EM) et le score F1. L'EM mesure le pourcentage de questions où la réponse prédite par le modèle correspond exactement à la vérité terrain, tandis que le F1 calcule le chevauchement de jetons entre la prédiction et la vérité terrain, permettant un crédit partiel. Comme les réponses sont de courts extraits, ces métriques fournissent une mesure simple de la précision.
Pour réussir sur MMQA, un modèle doit non seulement comprendre chaque modalité individuellement, mais aussi apprendre à aligner et à fusionner les informations entre elles. Cela nécessite des architectures sophistiquées capables d'encoder les images, les tableaux et les vidéos dans un espace de représentation commun, souvent en utilisant des modèles de vision et de langage pré-entraînés. Les premières lignes de base, comme la simple concaténation de caractéristiques, ont obtenu de mauvais résultats, soulignant la nécessité de techniques plus avancées de fusion multimodale.
Impact et travaux connexes
MMQA a influencé les recherches ultérieures en compréhension multimodale et a été utilisé comme référence dans de nombreuses études. Il est souvent cité aux côtés d'autres ensembles de données multimodaux comme Visual Question Answering (VQA) et TextVQA, mais il se distingue par l'inclusion de tableaux et de vidéos, moins courants dans d'autres références. L'ensemble de données a stimulé le développement de modèles capables de raisonner conjointement sur le texte et les images, et des extensions ultérieures ont incorporé l'audio et d'autres modalités.
La publication de MMQA a coïncidé avec l'essor des grands modèles de langage et des systèmes de IA générative, qui ont montré des capacités remarquables dans les tâches multimodales. Cependant, même les modèles les plus avancés en 2024 trouvent encore MMQA difficile, en particulier pour les questions nécessitant un raisonnement précis sur les tableaux ou les vidéos. Cela a fait de MMQA un test de résistance précieux pour évaluer la robustesse des systèmes d'intelligence artificielle dans des scénarios du monde réel.
Limites et orientations futures
Une limite de MMQA est qu'il repose sur des articles Wikipédia, principalement en anglais et avec un biais occidental. Cela limite la diversité des contextes culturels et linguistiques représentés dans l'ensemble de données. De plus, les réponses sont contraintes à de courts extraits, ce qui peut ne pas capturer toute la complexité de certaines questions nécessitant des explications plus longues.
Les travaux futurs dans ce domaine pourraient consister à étendre MMQA à davantage de langues, à des sources plus diversifiées et à des réponses plus longues. Les chercheurs explorent également comment rendre les modèles plus interprétables, afin qu'ils puissent expliquer le processus de raisonnement derrière leurs réponses. Alors que l'IA multimodale continue d'évoluer, des ensembles de données comme MMQA resteront essentiels pour mesurer les progrès et identifier les domaines où les modèles sont encore loin d'une compréhension de niveau humain.