Traduzido do inglês

Visual Commonsense Reasoning (VCR) é um benchmark e tarefa de IA que exige que modelos respondam a perguntas sobre imagens usando conhecimento de senso comum, envolvendo compreensão visual, raciocínio e geração de explicações.

Visual Commonsense Reasoning (VCR) é um benchmark de pesquisa e uma tarefa em inteligência artificial que avalia a capacidade de um sistema para comprender imagens e responder perguntas sobre elas usando conhecimento de senso comum. Introducido em 2019, o VCR exige que os modelos não apenas identifiquen objetos e ações em uma escena, mas também infieran motivações, estados mentais e eventos futuros plausibles. Está diseñado para testar cognición de nível superior más allá del reconocimiento visual básico, uniendo la brecha entre Computer vision y Natural language processing.

El conjunto de datos VCR consta de más de 290.000 preguntas de opción múltiple derivadas de 110.000 escenas de películas, cada una emparejada con una pregunta, cuatro opciones de respuesta y cuatro opciones de justificación. Un modelo debe seleccionar la respuesta correcta y luego justificar su elección seleccionando la justificación correcta. Esta estructura de dos etapas obliga a los sistemas a producir explicaciones, haciendo que el benchmark sea más desafiante que la respuesta visual a preguntas (VQA) tradicional. La tarea se divide en dos sub-tareas: Query-Answer (QA) y Answer-Rationale (AR), con el rendimiento general medido por la puntuación VCR, que es el producto de la precisión en ambas sub-tareas.

Dataset y Anotación

El conjunto de datos VCR fue creado por investigadores de la Universidad de Carolina del Norte en Chapel Hill y el Instituto Allen de Inteligencia Artificial. Las anotaciones se realizaron mediante crowdsourcing con Amazon Mechanical Turk, pidiendo a los trabajadores que escribieran preguntas que requirieran razonamiento de sentido común, como "¿Por qué está corriendo la persona?" o "¿Qué sucederá después?". Cada pregunta se basa en una imagen específica de una película, proporcionando pistas contextuales ricas como interacciones sociales, expresiones emocionales y causalidad física. El conjunto incluye 110.000 clips de películas únicos, cada uno con un promedio de 2,6 preguntas, resultando en un conjunto diverso de escenarios que no están sesgados hacia el reconocimiento de objetos únicamente.

Formulación de la Tarea

Formalmente, VCR se define como una tarea de opción múltiple. Dada una imagen I, una pregunta Q y un conjunto de cuatro candidatos de respuesta A = {a1, a2, a3, a4}, el modelo debe predecir la respuesta correcta a. Luego, dada la misma imagen, pregunta y la respuesta correcta, el modelo debe seleccionar la justificación correcta R de un conjunto de cuatro candidatos de justificación. La puntuación final VCR se calcula como la precisión de seleccionar tanto la respuesta correcta como la justificación correcta, es decir, la probabilidad conjunta P(a | I, Q) P(r | I, Q, a*). Esta formulación anima a los modelos a producir explicaciones coherentes en lugar de simplemente adivinar la respuesta.

Enfoques de Modelos

Los primeros sistemas VCR se basaron en arquitecturas de Visual Question Answering que combinaban redes neuronales convolucionales (CNN) para la extracción de características de imagen con redes neuronales recurrentes (RNN) o codificadores basados en Transformer (architecture) para el texto. Una línea base común fue el modelo Visual Commonsense Reasoning with Transformer (VCRT), que utilizaba un mecanismo de Multi-Head Attention para fusionar representaciones visuales y textuales. Posteriormente, enfoques basados en Large language model, como el ajuste fino de BERT o variantes de GPT, se adaptaron para manejar la entrada multimodal. Estos modelos suelen emplear un pipeline de dos etapas: primero, codifican la imagen y la pregunta conjuntamente, luego usan una cabeza de clasificación para seleccionar la respuesta y la justificación. Trabajos más recientes han explorado el entrenamiento de extremo a extremo con capas de Cross-Attention, permitiendo al modelo atender a regiones relevantes de la imagen mientras razona sobre la pregunta.

Desafíos y Limitaciones

A pesar del progreso, VCR sigue siendo un benchmark difícil. Los modelos a menudo luchan con preguntas que requieren razonamiento social profundo, como inferir la intención o el estado emocional de un personaje. El conjunto de datos también contiene sesgos, ya que algunas preguntas pueden responderse mediante regularidades estadísticas en el texto en lugar de evidencia visual. Por ejemplo, un modelo podría aprender a asociar ciertos verbos con objetos típicos sin comprender realmente la escena. Además, la tarea de selección de justificación es particularmente desafiante porque requiere que el modelo genere una explicación plausible que no sea solo una paráfrasis de la respuesta. A partir de 2025, los mejores modelos en VCR logran alrededor del 80% de precisión en la sub-tarea QA y 75% en la sub-tarea AR, pero la puntuación conjunta VCR permanece por debajo del 60%, indicando un margen significativo de mejora.

Impacto y Trabajo Relacionado

VCR ha influido en benchmarks posteriores como Visual Commonsense Reasoning in the Wild (VCR-W) y se ha utilizado como banco de pruebas para evaluar las capacidades de razonamiento de sentido común en sistemas de IA. También ha impulsado la investigación en Explainable AI, ya que el componente de selección de justificación obliga a los modelos a proporcionar justificaciones interpretables. El conjunto de datos está disponible públicamente y ha sido ampliamente adoptado en la comunidad de investigación, con más de 1.000 citas a partir de 2025. VCR se compara a menudo con otras tareas de razonamiento visual como el entailment visual y Visual Question Answering, pero su énfasis en explicaciones lo distingue. El benchmark es mantenido por el Instituto Allen de IA y se utiliza regularmente en competiciones y talleres académicos.

Direcciones Futuras

El trabajo futuro en VCR puede implicar la integración de arquitecturas más sofisticadas de Neural network, como modelos de visión-lenguaje preentrenados en pares de imagen-texto a gran escala. También hay interés en usar VCR para evaluar las capacidades de razonamiento de sistemas de Generative AI, donde los modelos deben generar justificaciones de forma libre en lugar de seleccionar de un conjunto fijo. Además, los investigadores están explorando formas de reducir el sesgo del conjunto de datos introduciendo ejemplos adversarios o preguntas contrafactuales. A medida que Artificial intelligence continúa avanzando, VCR sirve como un benchmark crítico para medir el progreso hacia el razonamiento visual de sentido común a nivel humano.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·natural-language-processing·commonsense-reasoning·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico