Traducido del inglés

VSWinoground es un conjunto de datos de referencia para evaluar modelos de visión y lenguaje en el razonamiento espacial visual, introducido en 2023 por investigadores de la Universidad de Toronto y otros.

VSWinoground es un conjunto de datos de referencia diseñado para evaluar las capacidades de razonamiento espacial visual de los modelos de visión-lenguaje. Fue introducido en 2023 por un equipo de investigadores, entre ellos Tristan Thrush, Ryan Jiang y colegas de la Universidad de Toronto y otras instituciones. El conjunto de datos se basa en el punto de referencia Winoground, que evalúa la comprensión composicional en pares de texto e imagen, pero se centra específicamente en relaciones espaciales como «arriba», «debajo», «a la izquierda de» y «a la derecha de».

El punto de referencia consta de 400 pares de imagen y leyenda, cada uno con dos leyendas que describen la misma imagen pero difieren en la disposición espacial de los objetos. Por ejemplo, una leyenda podría decir «el gato está encima del perro» mientras que la otra dice «el perro está encima del gato». Se pide a los modelos que seleccionen la leyenda correcta para una imagen dada, y viceversa. El conjunto de datos está disponible públicamente y se ha utilizado en varios estudios de investigación para evaluar el rendimiento de los modelos.

Diseño y evaluación

VSWinoground se construye mediante un proceso semiautomatizado que genera imágenes a partir de escenas 3D sintéticas, lo que garantiza un control preciso sobre las disposiciones espaciales. Cada imagen se renderiza con dos objetos colocados en una relación espacial específica, y las leyendas se generan mediante plantillas. El punto de referencia incluye tanto una tarea de recuperación de «texto a imagen» como de «imagen a texto», y los modelos se puntúan según la precisión en cada tarea, así como una puntuación «de grupo» combinada que requiere un rendimiento correcto en ambas tareas para un par dado.

Las evaluaciones iniciales en varios modelos de última generación, incluidos CLIP y ViLT, mostraron que estos rinden solo ligeramente mejor que el azar (alrededor del 50 % de precisión) en la tarea de imagen a texto, y significativamente peor en la tarea de texto a imagen. Por ejemplo, CLIP logró aproximadamente un 52 % de precisión en imagen a texto y un 48 % en texto a imagen, mientras que ViLT obtuvo alrededor del 50 % en ambas. Estos resultados resaltan la dificultad del razonamiento espacial visual para los modelos actuales.

Puntos de referencia relacionados

VSWinoground forma parte de una familia más amplia de puntos de referencia de estilo Winoground que evalúan la comprensión composicional y espacial. El conjunto de datos original de Winoground, introducido en 2022 por investigadores de Google DeepMind, contiene 400 pares de imagen y leyenda con variaciones composicionales más generales. Otros puntos de referencia relacionados incluyen VSR (Razonamiento Espacial Visual), que utiliza imágenes reales y se centra en relaciones espaciales, y el más reciente Winoground-V2, que amplía el conjunto de datos original. Estos puntos de referencia se utilizan a menudo juntos para evaluar la robustez de los modelos de visión-lenguaje.

Limitaciones y críticas

Una limitación de VSWinoground es su tamaño relativamente pequeño (400 pares), lo que puede provocar una alta varianza en los resultados de la evaluación. Además, dado que las imágenes son sintéticas, es posible que no capturen por completo la complejidad del razonamiento espacial del mundo real. Algunos investigadores han argumentado que el enfoque del punto de referencia en preposiciones espaciales simples puede no reflejar toda la gama de razonamiento espacial requerido en aplicaciones prácticas. No obstante, VSWinoground sigue siendo un recurso ampliamente citado para sondear las capacidades de los modelos.

Impacto y direcciones futuras

VSWinoground se ha utilizado en varios estudios para analizar las limitaciones de los modelos de visión-lenguaje, particularmente en el contexto de los grandes modelos de lenguaje y el aprendizaje multimodal. También ha inspirado trabajos posteriores sobre la mejora del razonamiento espacial, como la incorporación de codificaciones espaciales explícitas o el uso de aumento de datos sintéticos. A partir de 2025, ningún modelo ha alcanzado un rendimiento a nivel humano en el punto de referencia, y este continúa sirviendo como un banco de pruebas desafiante para la comunidad de investigación en IA.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·vision-language·spatial-reasoning·evaluation
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial