Traduit de l'anglais

OK-VQA est un benchmark de réponse aux questions visuelles conçu pour évaluer la capacité des systèmes d'IA à répondre à des questions nécessitant des connaissances externes au-delà du contenu de l'image, comprenant 14 031 questions réparties sur 14 031 images.

OK-VQA (Outside Knowledge Visual Question Answering) est un jeu de données de référence pour évaluer les systèmes de réponse à des questions visuelles (VQA). Contrairement aux jeux de données VQA antérieurs qui se concentrent sur des questions auxquelles on peut répondre à partir de la seule image, OK-VQA exige spécifiquement que les modèles intègrent des connaissances externes sur les objets, les scènes et les concepts du quotidien pour produire des réponses correctes. Ce jeu de données a été introduit en 2019 par des chercheurs du Georgia Institute of Technology, notamment Kenneth Marino, Mohammad Rastegari, Ali Farhadi et Roozbeh Mottaghi, et est depuis devenu un banc d'essai standard pour l'étude des modèles vision-langage augmentés de connaissances.

Le banc d'essai comprend 14 031 questions associées à 14 031 images, chaque image ayant exactement une question. Les questions sont conçues pour être sans ambiguïté et nécessitent des connaissances externes qui ne sont pas visuellement présentes. Par exemple, une question pourrait demander « Quel type d'animal est-ce ? » lorsque l'image montre une créature partiellement obscurcie, ou « Quel est l'usage de cet outil ? » pour un objet inconnu. Le jeu de données couvre un large éventail de domaines de connaissances, notamment l'alimentation, les animaux, les véhicules, les sports et les articles ménagers, garantissant une diversité et mettant les modèles au défi de raisonner sur le contexte du monde réel.

Construction et annotation

OK-VQA a été construit en externalisant les questions auprès de travailleurs d'Amazon Mechanical Turk. Le processus d'annotation consistait à montrer une image aux travailleurs et à leur demander de générer une question qui ne pouvait pas être répondue en regardant uniquement l'image, mais qui nécessitait du bon sens ou des connaissances factuelles. Pour garantir la qualité, chaque question a été validée par plusieurs annotateurs, et seules celles présentant un accord inter-annotateurs élevé ont été conservées. Le jeu de données final a ensuite été divisé en ensembles d'entraînement (9 009 questions), de validation (2 016 questions) et de test (3 006 questions). L'ensemble de test est utilisé pour l'évaluation officielle via un serveur en ligne, avec la précision comme métrique principale.

Évaluation et métriques

La métrique d'évaluation standard pour OK-VQA est la précision de correspondance exacte, où la réponse prédite par un modèle est considérée comme correcte si elle correspond exactement à l'une des réponses de référence. Chaque question comporte 10 réponses de référence fournies par différents annotateurs, et une prédiction est notée comme correcte si elle correspond à l'une d'elles. Cette approche tient compte de la variabilité dans la formulation des réponses par les humains. Les modèles sont généralement évalués sur l'ensemble de test, mais les chercheurs utilisent souvent l'ensemble de validation pour le développement et le réglage des hyperparamètres.

Défis et limites

OK-VQA pose plusieurs défis aux systèmes d'IA. Premièrement, il nécessite d'intégrer des informations visuelles avec une large base de connaissances sur le monde, ce qui est difficile pour les modèles entraînés principalement sur des paires image-texte. Deuxièmement, de nombreuses questions sont ambiguës ou nécessitent un raisonnement sur un contexte implicite, comme la compréhension de pratiques culturelles ou de propriétés physiques. Troisièmement, le jeu de données a été critiqué pour contenir certaines questions auxquelles on peut répondre à partir de la seule image malgré l'intention de conception, et pour sa taille relativement petite par rapport à d'autres bancs d'essai VQA. De plus, la métrique de correspondance exacte peut être sévère, pénalisant les réponses sémantiquement correctes mais formulées différemment.

Impact et utilisation

OK-VQA est devenu un banc d'essai largement utilisé dans les domaines du apprentissage automatique et de la vision par ordinateur. Il a été adopté par les chercheurs pour évaluer des modèles qui combinent des encodeurs visuels avec des modèles de langage de grande taille, utilisant souvent des techniques comme l'attention croisée pour fusionner les représentations d'images et de texte. De nombreux modèles vision-langage de pointe, y compris ceux basés sur des architectures transformers, rapportent leurs performances sur OK-VQA comme un indicateur clé de leur capacité à effectuer un raisonnement basé sur les connaissances. Le jeu de données a également stimulé le développement de méthodes spécialisées pour la récupération et l'intégration de connaissances, telles que l'incorporation de bases de connaissances externes ou l'utilisation de techniques de augmentation de données pour améliorer la généralisation.

Bancs d'essai connexes

OK-VQA fait partie d'une famille plus large de bancs d'essai VQA. Le jeu de données VQA original, introduit en 2015, se concentre sur des questions auxquelles on peut répondre à partir du contenu de l'image. D'autres bancs d'essai connexes incluent Visual Genome, qui met l'accent sur les relations et les attributs, et GQA, qui teste le raisonnement compositionnel. Des bancs d'essai plus récents comme A-OKVQA étendent OK-VQA en fournissant des options de réponse supplémentaires et des annotations de justification. OK-VQA reste distinct par son accent explicite sur les connaissances externes, ce qui en fait une ressource unique pour étudier l'intersection de la perception et du raisonnement en IA.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:visual-question-answering·benchmark·computer-vision·dataset
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique