Visual Commonsense Reasoning (VCR) est un benchmark de recherche et une tâche en intelligence artificielle qui évalue la capacité d'un système à comprendre des images et à répondre à des questions à leur sujet en utilisant des connaissances de sens commun. Introduit en 2019, VCR exige des modèles non seulement d'identifier les objets et les actions dans une scène, mais aussi d'inférer les motivations, les états mentaux et les événements futurs plausibles. Il est conçu pour tester une cognition de niveau supérieur au-delà de la reconnaissance visuelle de base, comblant le fossé entre Computer vision et Natural language processing.
Le jeu de données VCR se compose de plus de 290 000 questions à choix multiples dérivées de 110 000 scènes de films, chacune étant associée à une question, quatre options de réponse et quatre options de justification. Un modèle doit sélectionner la bonne réponse, puis justifier son choix en sélectionnant la bonne justification. Cette structure en deux étapes force les systèmes à produire des explications, rendant le benchmark plus difficile que la réponse à des questions visuelles traditionnelle (VQA). La tâche est divisée en deux sous-tâches : Query-Answer (QA) et Answer-Rationale (AR), avec la performance globale mesurée par le score VCR, qui est le produit de la précision sur les deux sous-tâches.
Dataset and Annotation
Le jeu de données VCR a été créé par des chercheurs de l'Université de Caroline du Nord à Chapel Hill et de l'Allen Institute for Artificial Intelligence. Les annotations ont été réalisées par crowdsourcing via Amazon Mechanical Turk, où les travailleurs devaient rédiger des questions nécessitant un raisonnement de sens commun, comme « Pourquoi la personne court-elle ? » ou « Que va-t-il se passer ensuite ? ». Chaque question est ancrée dans une image spécifique d'un film, fournissant des indices contextuels riches comme les interactions sociales, les expressions émotionnelles et la causalité physique. Le jeu de données comprend 110 000 clips de films uniques, chacun avec une moyenne de 2,6 questions, résultant en un ensemble diversifié de scénarios qui ne sont pas biaisés vers la seule reconnaissance d'objets.
Task Formulation
Formellement, VCR est défini comme une tâche à choix multiples. Étant donné une image I, une question Q et un ensemble de quatre candidats de réponse A = {a1, a2, a3, a4}, le modèle doit prédire la bonne réponse a. Ensuite, étant donné la même image, la question et la bonne réponse, le modèle doit sélectionner la bonne justification R parmi un ensemble de quatre candidats de justification. Le score VCR final est calculé comme la précision de sélection à la fois de la bonne réponse et de la bonne justification, c'est-à-dire la probabilité conjointe P(a | I, Q) P(r | I, Q, a*). Cette formulation encourage les modèles à produire des explications cohérentes plutôt que de simplement deviner la réponse.
Model Approaches
Les premiers systèmes VCR reposaient sur des architectures de Visual Question Answering qui combinaient des réseaux de neurones convolutifs (CNN) pour l'extraction de caractéristiques d'image avec des réseaux de neurones récurrents (RNN) ou des encodeurs basés sur Transformer (architecture) pour le texte. Un baseline courant était le modèle Visual Commonsense Reasoning with Transformer (VCRT), qui utilisait un mécanisme de Multi-Head Attention pour fusionner les représentations visuelles et textuelles. Plus tard, des approches basées sur Large language model, comme le fine-tuning de BERT ou des variantes de GPT, ont été adaptées pour traiter l'entrée multimodale. Ces modèles utilisent souvent un pipeline en deux étapes : d'abord, ils encodent l'image et la question conjointement, puis ils utilisent une tête de classification pour sélectionner la réponse et la justification. Des travaux plus récents ont exploré l'entraînement de bout en bout avec des couches de Cross-Attention, permettant au modèle de se concentrer sur les régions d'image pertinentes tout en raisonnant sur la question.
Challenges and Limitations
Malgré les progrès, VCR reste un benchmark difficile. Les modèles échouent souvent sur des questions qui exigent un raisonnement social profond, comme inférer l'intention ou l'état émotionnel d'un personnage. Le jeu de données contient également des biais, car certaines questions peuvent être résolues par des régularités statistiques dans le texte plutôt que par des preuves visuelles. Par exemple, un modèle pourrait apprendre à associer certains verbes à des objets typiques sans vraiment comprendre la scène. De plus, la tâche de sélection de justification est particulièrement difficile car elle exige que le modèle génère une explication plausible qui n'est pas simplement une paraphrase de la réponse. En 2025, les meilleurs modèles sur VCR atteignent environ 80 % de précision sur la sous-tâche QA et 75 % sur la sous-tâche AR, mais le score VCR conjoint reste inférieur à 60 %, indiquant une marge d'amélioration significative.
Impact and Related Work
VCR a influencé des benchmarks ultérieurs tels que Visual Commonsense Reasoning in the Wild (VCR-W) et a été utilisé comme banc d'essai pour évaluer les capacités de raisonnement de sens commun dans les systèmes d'IA. Il a également stimulé la recherche en Explainable AI, car la composante de sélection de justification force les modèles à fournir des justifications interprétables. Le jeu de données est publiquement disponible et a été largement adopté dans la communauté de recherche, avec plus de 1 000 citations en 2025. VCR est souvent comparé à d'autres tâches de raisonnement visuel comme l'implication visuelle et Visual Question Answering, mais son accent sur les explications le distingue. Le benchmark est maintenu par l'Allen Institute for AI et est régulièrement utilisé dans des compétitions et ateliers académiques.
Future Directions
Les travaux futurs sur VCR pourraient impliquer l'intégration d'architectures de Neural network plus sophistiquées, comme des modèles vision-langage pré-entraînés sur de grandes paires image-texte. Il y a aussi un intérêt à utiliser VCR pour évaluer les capacités de raisonnement des systèmes de Generative AI, où les modèles doivent générer des justifications en texte libre au lieu de sélectionner parmi un ensemble fixe. De plus, les chercheurs explorent des moyens de réduire le biais du jeu de données en introduisant des exemples adversariaux ou des questions contrefactuelles. Alors que Artificial intelligence continue de progresser, VCR sert de benchmark critique pour mesurer les progrès vers un raisonnement visuel de sens commun de niveau humain.