MultimodalQA est un ensemble de données de référence conçu pour évaluer les systèmes de réponse aux questions qui doivent raisonner sur des informations présentées à la fois sous forme textuelle et visuelle. Il a été introduit pour remédier aux limitations des ensembles de données antérieurs qui se concentraient uniquement sur la réponse aux questions textuelles ou uniquement sur les images, offrant ainsi un banc d'essai plus réaliste et plus difficile pour les systèmes d'intelligence artificielle. Cet ensemble de données se distingue par l'utilisation d'annotations hétérogènes, ce qui signifie que différentes questions de l'ensemble nécessitent différents types de raisonnement, comme combiner des informations d'un passage de texte et d'une image, ou effectuer un raisonnement en plusieurs étapes impliquant les deux modalités de manière séquentielle.
L'objectif principal de MultimodalQA est de repousser les limites de la compréhension multimodale dans l'apprentissage automatique et l'apprentissage profond. Contrairement aux références plus simples qui peuvent ne nécessiter que la localisation d'une réponse dans une source unique, MultimodalQA inclut des questions qui exigent un raisonnement complexe, comme comparer des informations entre les modalités, effectuer des opérations arithmétiques sur des données extraites d'une image, ou suivre une chaîne de raisonnement qui alterne entre preuves textuelles et visuelles. Cette conception en fait une ressource précieuse pour les chercheurs qui développent et évaluent les grands modèles de langage et d'autres architectures de réseaux neuronaux visant à intégrer la compréhension visuelle et textuelle.
Structure et composition de l'ensemble de données
MultimodalQA est construit sur l'ensemble de données WebQA, qui contient lui-même des questions et des réponses dérivées d'articles de Wikipédia. Les créateurs de MultimodalQA ont sélectionné un sous-ensemble des données de WebQA et l'ont enrichi de paires question-réponse supplémentaires pour créer une référence plus équilibrée et plus difficile. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant lui-même subdivisé en un ensemble de test public et un ensemble de test caché utilisé pour l'évaluation officielle. L'ensemble de test caché est particulièrement important pour prévenir le sur-apprentissage et garantir que les modèles généralisent bien aux données non vues.
Une caractéristique clé de MultimodalQA est sa catégorisation des questions en fonction du type de raisonnement requis. L'ensemble de données comprend des catégories telles que « Texte + Image », où la réponse nécessite de combiner des informations d'un passage de texte et d'une image, et « Multi-étapes », où la question nécessite une séquence d'étapes de raisonnement, impliquant potentiellement plusieurs sources. D'autres catégories incluent les questions « Image » uniquement et « Texte » uniquement, qui servent de contrôles pour mesurer la performance d'un modèle sur des tâches unimodales dans le même cadre. Cette catégorisation permet aux chercheurs d'analyser en détail les forces et les faiblesses spécifiques de leurs modèles.
Évaluation et métriques
La principale métrique d'évaluation pour MultimodalQA est la précision, définie comme le pourcentage de questions pour lesquelles la réponse prédite par le modèle correspond exactement à la réponse de référence. Pour les questions avec plusieurs réponses acceptables, une prédiction est considérée comme correcte si elle correspond à l'une des réponses fournies. L'ensemble de données inclut également une référence de « performance humaine », établie en faisant répondre à un échantillon de questions par des annotateurs humains. Cette référence fournit un point de comparaison pour évaluer à quel point les systèmes d'IA sont proches de la performance de niveau humain sur cette tâche.
Dans l'article original présentant MultimodalQA, les auteurs ont évalué plusieurs modèles de base, y compris un modèle transformeur multimodal adapté de l'architecture VisualBERT. Ce modèle, qui utilisait une approche de fusion tardive pour combiner les caractéristiques visuelles et textuelles, a atteint une précision d'environ 46 % sur l'ensemble de test caché, nettement inférieure à la performance humaine d'environ 88 %. Cet écart important a souligné la difficulté de la référence et a mis en évidence la nécessité de capacités de raisonnement plus sophistiquées dans les systèmes d'IA.
Importance et impact
MultimodalQA est devenu une référence largement utilisée dans le domaine de la recherche en IA multimodale. Il a été adopté par de nombreux groupes de recherche et entreprises, y compris ceux de grandes entreprises technologiques et d'institutions académiques, pour évaluer la performance de leurs modèles. L'accent mis par l'ensemble de données sur le raisonnement hétérogène a stimulé le développement de nouvelles architectures et de techniques d'entraînement qui vont au-delà de la simple concaténation de caractéristiques. Par exemple, certains travaux ultérieurs ont exploré l'utilisation de réseaux neuronaux modulaires capables de router dynamiquement les informations entre les encodeurs visuels et textuels, tandis que d'autres ont étudié l'utilisation de bases de connaissances externes pour soutenir le raisonnement.
La référence a également contribué à la discussion plus large sur l'évaluation en intelligence artificielle. En démontrant qu'une performance élevée sur des références unmodales ne se traduit pas nécessairement par un succès sur des tâches multimodales, MultimodalQA a encouragé la communauté à développer des suites d'évaluation plus holistiques. Il a également été utilisé comme composant dans des références plus vastes, telles que la version multimodale de la suite SuperGLUE, renforçant ainsi son rôle en tant qu'outil standard pour évaluer les capacités de l'IA.
Limites et orientations futures
Malgré ses points forts, MultimodalQA présente certaines limites. L'ensemble de données est principalement en anglais et dérivé de Wikipédia, ce qui signifie qu'il peut ne pas capturer pleinement la diversité des données multimodales du monde réel. De plus, les questions, bien que difficiles, restent relativement courtes et peuvent ne pas refléter la complexité des requêtes humaines naturelles dans des contextes interactifs. Les chercheurs ont noté que la dépendance de l'ensemble de données à la précision de correspondance exacte peut être fragile, car elle ne tient pas compte des réponses sémantiquement équivalentes mais formulées différemment.
Les travaux futurs sur la réponse aux questions multimodales devraient remédier à ces limites en créant des ensembles de données avec des sources plus diverses, des questions plus longues et plus conversationnelles, et des métriques d'évaluation plus flexibles. Il existe également un intérêt croissant pour l'utilisation de grands modèles de langage avec des capacités de vision intégrées, tels que ceux développés par des organisations comme OpenAI et Google DeepMind, pour aborder des références comme MultimodalQA. À mesure que ces modèles continuent de s'améliorer, il est prévu que l'écart entre la performance de l'IA et celle des humains sur MultimodalQA se réduise, bien que la référence restera probablement un outil précieux pour mesurer les progrès en matière de raisonnement multimodal pendant des années à venir.
Voir aussi
- intelligence artificielle
- apprentissage automatique
- apprentissage profond
- réseau de neurones
- grand modèle de langage
- transformeur
- attention multi-têtes
- attention croisée
- encodeur-décodeur
- séquence à séquence
- augmentation de données
- apprentissage par programme
- fonctions de perte
- élagage de modèle
- mise à l'échelle de température
- échantillonnage top-k
- échantillonnage top-p
- recherche en faisceau
- réseau résiduel
- normalisation par lots