Traduit de l'anglais

VSWinoground est un ensemble de données de référence pour évaluer les modèles vision-langage sur le raisonnement spatial visuel, introduit en 2023 par des chercheurs de l'Université de Toronto et d'autres.

VSWinoground est un ensemble de données de référence conçu pour évaluer les capacités de raisonnement spatial visuel des modèles vision-langage. Il a été introduit en 2023 par une équipe de chercheurs comprenant Tristan Thrush, Ryan Jiang et leurs collègues de l'Université de Toronto et d'autres institutions. L'ensemble de données s'appuie sur le benchmark Winoground, qui teste la compréhension compositionnelle dans les paires texte-image, mais se concentre spécifiquement sur les relations spatiales telles que « au-dessus », « en dessous », « à gauche de » et « à droite de ».

Le benchmark se compose de 400 paires image-légende, chacune avec deux légendes qui décrivent la même image mais diffèrent par l'arrangement spatial des objets. Par exemple, une légende pourrait indiquer « le chat est au-dessus du chien » tandis que l'autre indique « le chien est au-dessus du chat ». Les modèles sont chargés de sélectionner la légende correcte pour une image donnée, et vice versa. L'ensemble de données est disponible publiquement et a été utilisé dans plusieurs études de recherche pour évaluer les performances des modèles.

Conception et évaluation

VSWinoground est construit à l'aide d'un pipeline semi-automatisé qui génère des images à partir de scènes 3D synthétiques, garantissant un contrôle précis des dispositions spatiales. Chaque image est rendue avec deux objets placés dans une relation spatiale spécifique, et les légendes sont générées à l'aide de modèles. Le benchmark inclut à la fois une tâche de récupération « texte-vers-image » et « image-vers-texte », et les modèles sont notés sur la précision pour chaque tâche, ainsi que sur un score « de groupe » combiné qui exige des performances correctes sur les deux tâches pour une paire donnée.

Les évaluations initiales sur plusieurs modèles de pointe, notamment CLIP et ViLT, ont montré qu'ils ne performent que légèrement mieux que le hasard (environ 50 % de précision) sur la tâche image-vers-texte, et nettement moins bien sur la tâche texte-vers-image. Par exemple, CLIP a atteint environ 52 % de précision sur image-vers-texte et 48 % sur texte-vers-image, tandis que ViLT a obtenu environ 50 % sur les deux. Ces résultats soulignent la difficulté du raisonnement spatial visuel pour les modèles actuels.

Benchmarks connexes

VSWinoground fait partie d'une famille plus large de benchmarks de style Winoground qui testent la compréhension compositionnelle et spatiale. L'ensemble de données Winoground original, introduit en 2022 par des chercheurs de Google DeepMind, contient 400 paires image-légende avec des variations compositionnelles plus générales. D'autres benchmarks connexes incluent VSR (Visual Spatial Reasoning), qui utilise des images réelles et se concentre sur les relations spatiales, ainsi que le plus récent Winoground-V2, qui étend l'ensemble de données original. Ces benchmarks sont souvent utilisés ensemble pour évaluer la robustesse des modèles vision-langage.

Limites et critiques

Une limite de VSWinoground est sa taille relativement petite (400 paires), ce qui peut entraîner une variance élevée dans les résultats d'évaluation. De plus, comme les images sont synthétiques, elles peuvent ne pas capturer pleinement la complexité du raisonnement spatial dans le monde réel. Certains chercheurs ont soutenu que l'accent mis par le benchmark sur les prépositions spatiales simples pourrait ne pas refléter l'ensemble des capacités de raisonnement spatial requises dans les applications pratiques. Néanmoins, VSWinoground reste une ressource largement citée pour sonder les capacités des modèles.

Impact et orientations futures

VSWinoground a été utilisé dans plusieurs études pour analyser les limites des modèles vision-langage, en particulier dans le contexte des grands modèles de langage et de l'apprentissage multimodal. Il a également inspiré des travaux de suivi sur l'amélioration du raisonnement spatial, tels que l'incorporation d'encodages spatiaux explicites ou l'utilisation d'augmentation de données synthétiques. En 2025, aucun modèle n'a atteint des performances de niveau humain sur ce benchmark, et il continue de servir de banc d'essai difficile pour la communauté de recherche en IA.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:benchmark·vision-language·spatial-reasoning·evaluation
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique