Traduit de l'anglais

Winogrande est un benchmark de raisonnement de sens commun à grande échelle pour les systèmes d'IA, introduit en 2019, qui teste la résolution de pronoms à travers des paires de phrases à compléter dérivées du défi original des schémas de Winograd.

Winogrande est un ensemble de données de référence conçu pour évaluer les capacités de raisonnement de sens commun des systèmes d'intelligence artificielle, en particulier dans le domaine de la résolution de pronoms. Il a été introduit en 2019 par des chercheurs de l'Allen Institute for AI (AI2) comme successeur à plus grande échelle et plus difficile du défi original des schémas de Winograd. Le nom est un mot-valise de « Winograd » et « grande », reflétant sa plus grande échelle. L'ensemble de données se compose de paires de phrases qui diffèrent par un seul mot, généralement un pronom, exigeant qu'un système résolve une référence ambiguë en utilisant des connaissances du monde plutôt que la seule association statistique.

La tâche principale de Winogrande est un problème de choix binaire. Chaque exemple présente une phrase avec un espace vide, et le système doit sélectionner l'antécédent correct pour un pronom parmi deux syntagmes nominaux candidats. Par exemple, une phrase pourrait être : « Le trophée ne rentre pas dans la valise marron parce qu'il est trop grand », où le système doit déterminer si « il » fait référence au trophée ou à la valise. La réponse correcte repose sur la compréhension des propriétés physiques et des relations de taille typiques, ce qui est trivial pour les humains mais difficile pour les machines. L'ensemble de données comprend 44 000 exemples, répartis en ensembles d'entraînement, de validation et de test, l'ensemble de test étant gardé privé pour éviter le surapprentissage.

Conception et construction

La construction de Winogrande a impliqué un processus en deux étapes pour garantir la qualité et la difficulté. D'abord

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:commonsense-reasoning·benchmark·natural-language-processing·ai-evaluation
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique