ReCoRD (Reading Comprehension with Commonsense Reasoning) est un jeu de données de référence pour évaluer les capacités de raisonnement des systèmes d'intelligence artificielle, notamment dans le domaine de la compréhension du langage naturel. Il a été introduit en 2018 par des chercheurs de l'Université du Maryland et de l'Université de Washington. Le jeu de données est conçu pour mesurer la capacité d'un modèle à effectuer un raisonnement de sens commun pendant la lecture, allant au-delà de la simple récupération de faits ou de la correspondance de motifs.
La tâche principale de ReCoRD implique un passage de texte, généralement tiré d'articles de presse, où certaines entités ont été masquées. Le modèle doit prédire l'entité masquée à partir d'une liste d'entités candidates qui apparaissent ailleurs dans le passage. De manière cruciale, la réponse correcte nécessite souvent de comprendre le contexte, de résoudre les coréférences et d'appliquer des connaissances du monde réel qui ne sont pas explicitement énoncées. Par exemple, si un passage mentionne une personne et une ville, et que l'entité masquée est un lieu, le modèle doit déduire quelle ville est pertinente en fonction du récit.
ReCoRD contient plus de 120 000 exemples, répartis en ensembles d'entraînement, de validation et de test. Les passages proviennent d'articles de presse, et les requêtes sont générées en masquant des entités nommées. Le jeu de données souligne que la réponse correcte est toujours l'une des entités candidates, toutes mentionnées dans le passage, ce qui en fait une tâche de type cloze avec un espace de réponses contraint. Cette conception force les modèles à raisonner sur les relations entre les entités et les événements décrits, plutôt que de s'appuyer sur des bases de connaissances externes.
Construction et Conception
Le jeu de données ReCoRD a été construit selon un processus en deux étapes. D'abord, des articles de presse ont été collectés à partir de diverses sources, et les entités nommées ont été identifiées à l'aide d'un reconnaisseur d'entités standard. Ensuite, pour chaque article, un ensemble de requêtes a été créé en masquant aléatoirement une entité et en fournissant une liste d'entités candidates qui apparaissent dans le même article. Les candidats incluent la réponse correcte et plusieurs distracteurs, qui sont d'autres entités du même article. Cela garantit que le modèle ne peut pas simplement choisir l'entité la plus fréquente ou se fier à des statistiques de surface.
Une caractéristique notable de ReCoRD est son accent sur le raisonnement de sens commun. Les requêtes sont conçues pour que la réponse correcte ne soit pas trivialement déterminée par le contexte local. Au lieu de cela, le modèle doit intégrer des informations à travers plusieurs phrases et déduire des relations implicites. Par exemple, si un passage décrit une personne remportant un prix dans un domaine spécifique, le modèle doit savoir que le prix est généralement associé à ce domaine, une connaissance de sens commun.
Le jeu de données a été divisé en 101 249 exemples d'entraînement, 6 353 exemples de validation et 10 000 exemples de test. L'ensemble de test est réservé, et les modèles sont évalués dessus via un système de soumission. La principale métrique d'évaluation est la précision de correspondance exacte, où l'entité prédite par le modèle doit correspondre exactement à la vérité terrain.
Évaluation et Performance
ReCoRD est devenu une référence standard dans le domaine du traitement du langage naturel. Les premiers modèles, y compris ceux basés sur des réseaux de neurones récurrents et les premières architectures de transformeurs, ont atteint des précisions de l'ordre de 60 à 70 % sur l'ensemble de validation. L'introduction de grands modèles de langage pré-entraînés, tels que BERT et ses successeurs, a considérablement amélioré les performances, certains modèles dépassant 90 % de précision d'ici 2020.
Cependant, même les modèles de pointe rencontrent encore des difficultés avec certains types de requêtes qui exigent un raisonnement de sens commun approfondi, comme celles impliquant un raisonnement temporel, spatial ou des conventions sociales nuancées. Cela a fait de ReCoRD un outil précieux pour diagnostiquer les limites des systèmes d'IA actuels. La référence a également été utilisée pour étudier l'impact de la taille des modèles, des données d'entraînement et des choix architecturaux sur la capacité de raisonnement.
Relation avec d'Autres Références
ReCoRD fait partie d'une famille plus large de références de compréhension en lecture, incluant SQuAD, RACE et DROP. Contrairement à SQuAD, qui se concentre sur l'extraction de segments de réponse à partir du texte, ReCoRD nécessite de sélectionner parmi un ensemble d'entités, ce qui en fait une tâche de cloze à choix multiples. Par rapport à RACE, qui est basé sur des examens d'anglais, le domaine journalistique de ReCoRD fournit un contexte plus diversifié et moins formalisé. DROP, en revanche, exige un raisonnement numérique, tandis que ReCoRD met l'accent sur l'inférence de sens commun.
ReCoRD est souvent utilisé en conjonction avec d'autres références pour fournir une évaluation complète des capacités d'un modèle. Il est particulièrement pertinent pour tester l'intégration des techniques d'intelligence artificielle et de apprentissage automatique dans la compréhension du langage naturel. La référence a été adoptée par des groupes de recherche dans de grandes institutions, notamment Google DeepMind, OpenAI et Anthropic, dans le cadre de leurs suites d'évaluation de modèles.
Impact et Orientations Futures
L'introduction de ReCoRD a stimulé davantage de recherches sur le raisonnement de sens commun en IA. Elle a mis en évidence l'écart entre la reconnaissance de motifs et la véritable compréhension, incitant à développer des modèles capables de raisonner sur des situations quotidiennes. Des références ultérieures, telles que CommonsenseQA et Social IQA, ont tiré parti des leçons apprises de ReCoRD, en se concentrant sur des connaissances de sens commun plus explicites.
Une limitation de ReCoRD est que les entités candidates proviennent toutes du même passage, ce qui peut parfois rendre la tâche plus facile si le modèle apprend à exploiter des indices statistiques. Des chercheurs ont proposé des variantes qui introduisent des connaissances externes ou exigent un raisonnement multi-sauts. Malgré ces défis, ReCoRD reste une référence largement citée et utilisée, et elle continue d'informer le développement de systèmes d'IA plus robustes et interprétables.
Au début des années 2020, ReCoRD est toujours considéré comme une référence pertinente, bien que les modèles plus récents atteignent souvent des scores quasi parfaits. Son héritage réside dans la démonstration de l'importance du raisonnement de sens commun dans la compréhension du langage naturel et dans la fourniture d'une tâche concrète pour mesurer les progrès dans ce domaine.