Traducido del inglés

Winoground es un punto de referencia para evaluar modelos de visión-lenguaje en la comprensión compositiva, que requiere que los modelos emparejen imágenes con descripciones que difieren solo en el orden de las palabras o en las relaciones entre objetos.

Winoground es un conjunto de datos de referencia y un conjunto de evaluación diseñado para probar la comprensión compositiva de los modelos de visión y lenguaje. Fue introducido en 2022 por investigadores de la Universidad de Toronto y otros, y se ha convertido en un punto de referencia estándar para evaluar si los modelos realmente comprenden la relación entre el contenido visual y la estructura lingüística, en lugar de depender de atajos estadísticos o correlaciones superficiales. El nombre del punto de referencia es un acrónimo de "Winograd" (en referencia al Desafío de Esquemas de Winograd para el lenguaje natural) y "ground" (como en anclar el lenguaje a las imágenes).

La tarea central en Winoground involucra un conjunto de 400 ejemplos cuidadosamente construidos. Cada ejemplo consiste en dos imágenes y dos leyendas. Las leyendas están diseñadas para ser compositivamente desafiantes: contienen el mismo conjunto de palabras pero en un orden diferente, lo que cambia el significado. Por ejemplo, una leyenda podría ser "el perro persigue al gato" mientras que la otra es "el gato persigue al perro". Las dos imágenes correspondientes representan cada escenario. Un modelo recibe ambas imágenes y ambas leyendas y debe emparejar correctamente cada leyenda con su imagen correspondiente. El éxito requiere que el modelo analice la estructura sintáctica de las leyendas y la alinee con las relaciones visuales en las imágenes, como los roles de agente-acción-paciente, preposiciones espaciales (por ejemplo, "sobre" vs. "en"), o emparejamientos de atributo-objeto.

El punto de referencia fue creado para abordar una debilidad conocida en muchos modelos de visión y lenguaje: a menudo funcionan bien en tareas que pueden resolverse reconociendo objetos individuales o utilizando prioridades lingüísticas, pero fallan cuando la tarea requiere comprender cómo el orden de las palabras cambia el significado. Por ejemplo, un modelo podría identificar correctamente que una imagen contiene un perro y un gato, pero podría no ser capaz de determinar qué animal está realizando la acción. Winoground proporciona una prueba controlada para esta habilidad, y ha revelado brechas significativas en el rendimiento incluso de los modelos más avanzados.

Diseño y Evaluación

Cada ejemplo de Winoground se puntúa en tres métricas separadas: "puntuación de leyenda", "puntuación de imagen" y "puntuación de grupo". La puntuación de leyenda mide la proporción de ejemplos donde el modelo empareja correctamente ambas leyendas con sus respectivas imágenes. La puntuación de imagen mide la proporción donde el modelo empareja correctamente ambas imágenes con sus respectivas leyendas (lo cual es simétrico pero puede diferir debido a asimetrías del modelo). La puntuación de grupo es la más estricta: requiere que el modelo obtenga ambos emparejamientos de leyenda a imagen correctos en un solo intento, lo que significa que el modelo no solo debe identificar el emparejamiento correcto, sino también evitar cualquier confusión entre las dos opciones.

El conjunto de datos fue construido por anotadores humanos que generaron los pares de imágenes y leyendas. Las leyendas fueron diseñadas para ser pares mínimos, difiriendo solo en un elemento compositivo específico. Las imágenes fueron luego obtenidas o generadas para coincidir con cada leyenda con precisión. Los creadores también filtraron los ejemplos para asegurar que no fueran resolubles solo mediante detección de objetos simple, y verificaron que los anotadores humanos pudieran resolver la tarea con una precisión casi perfecta, estableciendo una línea base humana.

Resultados y Hallazgos

Las evaluaciones iniciales de modelos prominentes de visión y lenguaje en Winoground mostraron que la mayoría de los modelos funcionaban al nivel del azar o cerca de él (alrededor del 25% para la puntuación de grupo, ya que hay dos emparejamientos posibles y el modelo debe elegir el correcto). Por ejemplo, modelos como CLIP (Preentrenamiento Contrastivo de Lenguaje e Imagen) y otras arquitecturas de doble codificador, que incrustan imágenes y texto en un espacio compartido, a menudo fallaban en distinguir entre las dos leyendas. Esto fue sorprendente porque estos modelos habían logrado puntuaciones altas en otros puntos de referencia como la recuperación de leyendas de imágenes o la respuesta a preguntas visuales. El fallo destacó que estos modelos no estaban realizando realmente un razonamiento compositivo; en cambio, a menudo se basaban en la presencia de objetos individuales o en correlaciones entre palabras y características visuales que no requerían comprender la estructura relacional.

Trabajos posteriores han utilizado Winoground para sondear las limitaciones de varias arquitecturas de modelos, incluidas aquellas basadas en transformers y modelos de lenguaje grandes cuando se combinan con codificadores visuales. Los investigadores han encontrado que los modelos con mecanismos de atención más sofisticados o que se entrenan con objetivos adicionales, como capas de atención cruzada o atención de múltiples cabezas, a veces muestran un rendimiento mejorado, pero incluso entonces, las puntuaciones permanecen muy por debajo de los niveles humanos. El punto de referencia también se ha utilizado para estudiar el efecto de la escala de los datos de entrenamiento y el uso de datos sintéticos, con algunos estudios que muestran que aumentar los datos de entrenamiento con ejemplos compositivos puede mejorar el rendimiento en Winoground, pero la generalización sigue siendo un desafío.

Relación con Otros Puntos de Referencia

Winoground es parte de una familia más amplia de puntos de referencia que prueban la generalización compositiva en IA. Está conceptualmente relacionado con el Desafío de Esquemas de Winograd en el procesamiento del lenguaje natural, que prueba la resolución de correferencia y el razonamiento de sentido común. En el dominio de visión y lenguaje, complementa otros puntos de referencia como VQA (Respuesta a Preguntas Visuales) y la recuperación de imagen-texto, pero aísla específicamente el aspecto compositivo. A diferencia de las tareas que permiten a los modelos usar prioridades lingüísticas o estadísticas de co-ocurrencia de objetos, Winoground obliga al modelo a usar la estructura sintáctica exacta de la leyenda. Esto lo convierte en una herramienta de diagnóstico valiosa para los investigadores que desarrollan nuevas arquitecturas, como aquellas basadas en redes residuales o u-nets para la codificación de imágenes, y para técnicas de entrenamiento como aprendizaje curricular o aprendizaje por refuerzo con retroalimentación de IA.

El punto de referencia también ha inspirado variaciones y extensiones, como Winoground para video o para entornos multilingües, aunque estas están menos estandarizadas. El conjunto de datos original está disponible públicamente, y se ha integrado en varios conjuntos de evaluación de modelos utilizados por empresas y laboratorios de investigación, incluidos los de OpenAI, Google DeepMind y Anthropic, como una forma de rastrear el progreso en la comprensión compositiva.

Limitaciones y Críticas

Algunos investigadores han señalado que Winoground tiene limitaciones. El conjunto de datos es relativamente pequeño (400 ejemplos), lo que puede llevar a una alta varianza en los resultados de evaluación, especialmente para modelos que son estocásticos. Los ejemplos también están todos en inglés y se centran en un conjunto limitado de fenómenos compositivos, como el orden sujeto-verbo-objeto y las relaciones espaciales, que pueden no capturar toda la gama de desafíos compositivos en la comprensión de visión y lenguaje. Además, la naturaleza binaria de la tarea (emparejar dos imágenes con dos leyendas) a veces puede resolverse mediante un modelo que usa una heurística simple, como centrarse en una sola palabra distintiva, sin comprender completamente la oración. A pesar de estas críticas, Winoground sigue siendo un punto de referencia ampliamente citado e influyente en el campo de la inteligencia artificial y el aprendizaje automático, y continúa utilizándose como una prueba estándar para nuevos modelos y métodos de entrenamiento.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·vision-language·compositionality·evaluation
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial