Traducido del inglés

Visual Commonsense Reasoning (VCR) es un punto de referencia y una tarea de IA que requiere que los modelos respondan preguntas sobre imágenes utilizando conocimiento de sentido común, lo que implica comprensión visual, razonamiento y generación de explicaciones.

El razonamiento de sentido común visual (VCR, por sus siglas en inglés) es un punto de referencia y una tarea de investigación en inteligencia artificial que evalúa la capacidad de un sistema para comprender imágenes y responder preguntas sobre ellas utilizando conocimiento de sentido común. Introducido en 2019, VCR requiere que los modelos no solo identifiquen objetos y acciones en una escena, sino que también infieran motivaciones, estados mentales y eventos futuros plausibles. Está diseñado para probar la cognición de nivel superior más allá del reconocimiento visual básico, cerrando la brecha entre visión por computadora y procesamiento del lenguaje natural.

El conjunto de datos de VCR consta de más de 290,000 preguntas de opción múltiple derivadas de 110,000 escenas de películas, cada una emparejada con una pregunta, cuatro opciones de respuesta y cuatro opciones de justificación. Un modelo debe seleccionar la respuesta correcta y luego justificar su elección seleccionando la justificación correcta. Esta estructura de dos etapas obliga a los sistemas a producir explicaciones, haciendo que el punto de referencia sea más desafiante que la respuesta visual a preguntas (VQA) tradicional. La tarea se divide en dos subtareas: Consulta-Respuesta (QA) y Respuesta-Justificación (AR), con el rendimiento general medido por la puntuación VCR, que es el producto de la precisión en ambas subtareas.

Conjunto de datos y anotación

El conjunto de datos de VCR fue creado por investigadores de la Universidad de Carolina del Norte en Chapel Hill y el Instituto Allen de Inteligencia Artificial. Las anotaciones se realizaron mediante crowdsourcing utilizando Amazon Mechanical Turk, donde se pidió a los trabajadores que escribieran preguntas que requirieran razonamiento de sentido común, como "¿Por qué está corriendo la persona?" o "¿Qué sucederá después?". Cada pregunta se basa en una imagen específica de una película, proporcionando pistas contextuales ricas como interacciones sociales, expresiones emocionales y causalidad física. El conjunto de datos incluye 110,000 clips de películas únicos, cada uno con un promedio de 2.6 preguntas, resultando en un conjunto diverso de escenarios que no están sesgados hacia el reconocimiento de objetos únicamente.

Formulación de la tarea

Formalmente, VCR se define como una tarea de opción múltiple. Dada una imagen I, una pregunta Q y un conjunto de cuatro candidatos de respuesta A = {a1, a2, a3, a4}, el modelo debe predecir la respuesta correcta a. Luego, dada la misma imagen, pregunta y respuesta correcta, el modelo debe seleccionar la justificación correcta R de un conjunto de cuatro candidatos de justificación. La puntuación final de VCR se calcula como la precisión de seleccionar tanto la respuesta correcta como la justificación correcta, es decir, la probabilidad conjunta P(a | I, Q) P(r | I, Q, a*). Esta formulación anima a los modelos a producir explicaciones coherentes en lugar de solo adivinar la respuesta.

Enfoques de modelos

Los primeros sistemas de VCR se basaban en arquitecturas de respuesta visual a preguntas que combinaban redes neuronales convolucionales (CNN) para la extracción de características de imagen con redes neuronales recurrentes (RNN) o codificadores basados en transformadores para el texto. Una línea base común era el modelo de Razonamiento de Sentido Común Visual con Transformador (VCRT), que utilizaba un mecanismo de atención de múltiples cabezas para fusionar representaciones visuales y textuales. Más tarde, los enfoques basados en modelos de lenguaje grandes, como el ajuste fino de BERT o variantes de GPT, se adaptaron para manejar la entrada multimodal. Estos modelos suelen emplear un pipeline de dos etapas: primero, codifican la imagen y la pregunta conjuntamente, luego usan una cabeza de clasificación para seleccionar la respuesta y la justificación. Trabajos más recientes han explorado el entrenamiento de extremo a extremo con capas de atención cruzada, permitiendo que el modelo atienda a regiones relevantes de la imagen mientras razona sobre la pregunta.

Desafíos y limitaciones

A pesar del progreso, VCR sigue siendo un punto de referencia difícil. Los modelos a menudo fallan en preguntas que requieren razonamiento social profundo, como inferir la intención o el estado emocional de un personaje. El conjunto de datos también contiene sesgos, ya que algunas preguntas pueden responderse mediante regularidades estadísticas en el texto en lugar de evidencia visual. Por ejemplo, un modelo podría aprender a asociar ciertos verbos con objetos típicos sin comprender realmente la escena. Además, la tarea de selección de justificación es particularmente desafiante porque requiere que el modelo genere una explicación plausible que no sea solo una paráfrasis de la respuesta. A partir de 2025, los modelos con mejor rendimiento en VCR logran alrededor del 80% de precisión en la subtarea QA y 75% en la subtarea AR, pero la puntuación conjunta de VCR permanece por debajo del 60%, indicando un margen significativo para mejorar.

Impacto y trabajo relacionado

VCR ha influido en puntos de referencia posteriores como el Razonamiento de Sentido Común Visual en la Naturaleza (VCR-W) y se ha utilizado como banco de pruebas para evaluar capacidades de razonamiento de sentido común en sistemas de IA. También ha impulsado la investigación en IA explicable, ya que el componente de selección de justificación obliga a los modelos a proporcionar justificaciones interpretables. El conjunto de datos está disponible públicamente y ha sido ampliamente adoptado en la comunidad de investigación, con más de 1,000 citas a partir de 2025. VCR se compara a menudo con otras tareas de razonamiento visual como el entailment visual y la respuesta visual a preguntas, pero su énfasis en explicaciones lo distingue. El punto de referencia es mantenido por el Instituto Allen de IA y se utiliza regularmente en competiciones y talleres académicos.

Direcciones futuras

El trabajo futuro en VCR puede implicar la integración de arquitecturas de redes neuronales más sofisticadas, como modelos de visión-lenguaje preentrenados en pares de imágenes y texto a gran escala. También hay interés en usar VCR para evaluar las habilidades de razonamiento de sistemas de IA generativa, donde los modelos deben generar justificaciones de forma libre en lugar de seleccionar de un conjunto fijo. Además, los investigadores están explorando formas de reducir el sesgo del conjunto de datos mediante la introducción de ejemplos adversarios o preguntas contrafactuales. A medida que la inteligencia artificial continúa avanzando, VCR sirve como un punto de referencia crítico para medir el progreso hacia el razonamiento de sentido común visual a nivel humano.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·natural-language-processing·commonsense-reasoning·benchmark
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial