Traduit de l'anglais

DROP est un benchmark de compréhension de lecture qui exige un raisonnement discret sur le texte, tel que l'arithmétique et le tri, au-delà de la simple extraction. Il a été introduit en 2019 pour défier les systèmes d'IA avec des questions qui demandent une inférence en plusieurs étapes.

DROP (Discrete Reasoning Over Paragraphs) est un ensemble de données de référence pour évaluer les systèmes de compréhension de lecture et de réponse aux questions. Il a été introduit en 2019 par des chercheurs de l'Université Carnegie Mellon et de l'Université de Washington. L'ensemble de données se compose de plus de 96 000 questions dérivées d'articles Wikipédia, conçues pour nécessiter des opérations de raisonnement discrètes telles que l'addition, le comptage, le tri et la comparaison, plutôt que de simplement extraire un passage de texte. Cela distingue DROP des ensembles de données de compréhension de lecture antérieurs comme SQuAD, qui testaient principalement la capacité à localiser des réponses directement dans le passage.

La création de DROP a été motivée par l'observation que de nombreux modèles de réponse aux questions existants excellaient dans l'extraction de réponses mais peinaient face à des questions exigeant de combiner des informations provenant de plusieurs parties d'un texte ou d'effectuer des opérations arithmétiques simples. L'ensemble de données a été conçu pour révéler ces limitations et pousser le domaine vers des capacités de raisonnement plus robustes. Chaque question de DROP est associée à un paragraphe d'un article Wikipédia, et la réponse peut être un passage, un nombre, une date ou une liste d'éléments. Les questions sont élaborées pour nécessiter des opérations telles que l'addition, la soustraction, le comptage, le tri et la comparaison, impliquant souvent un raisonnement temporel ou numérique.

Structure de l'ensemble de données et évaluation

L'ensemble de données DROP est divisé en ensembles d'entraînement, de développement et de test. L'ensemble d'entraînement contient environ 77 000 questions, l'ensemble de développement environ 9 500, et l'ensemble de test environ 9 500. Chaque instance comprend un passage, une question et une ou plusieurs réponses de référence. L'évaluation est effectuée à l'aide de la correspondance exacte (EM) et du score F1, qui mesurent le chevauchement entre les réponses prédites et les réponses de référence. Étant donné que les réponses peuvent être des nombres ou des listes, le script d'évaluation normalise les formats et gère les variations telles que les virgules et les formats de date.

Performance initiale et défis

Lorsque DROP a été publié, les meilleurs modèles de l'époque atteignaient des scores F1 d'environ 30 à 40 %, bien en dessous de la performance humaine, estimée à environ 96 % de F1. L'ensemble de données a mis en évidence des lacunes significatives dans les capacités de raisonnement des modèles neuronaux existants, en particulier dans le traitement des opérations numériques et de l'inférence en plusieurs étapes. Les premières tentatives pour résoudre DROP impliquaient souvent des systèmes hybrides combinant la compréhension de lecture neuronale avec des modules de raisonnement symbolique, tels que des calculateurs arithmétiques ou des générateurs de programmes.

Progrès ultérieurs et techniques

Au fil du temps, les améliorations dans l'architecture des modèles et les méthodes d'entraînement ont conduit à des gains substantiels sur DROP. L'introduction de modèles basés sur Transformer, en particulier ceux pré-entraînés sur de grands corpus, a contribué à améliorer les performances. Des modèles comme BERT et ses successeurs, lorsqu'ils sont affinés sur DROP, ont obtenu des scores plus élevés mais ont toujours rencontré des difficultés avec le raisonnement complexe. Plus tard, des approches intégrant des outils externes, tels que la synthèse de programmes ou des fonctions de perte spécialisées, ont permis aux modèles d'effectuer des opérations arithmétiques explicites. D'ici 2021, certains systèmes ont atteint des scores F1 supérieurs à 85 %, se rapprochant de la performance humaine, principalement grâce à l'utilisation de grands modèles pré-entraînés et à l'intégration de composants de raisonnement symbolique.

Impact sur la recherche en IA

L'ensemble de données DROP a eu un impact durable sur le domaine du traitement du langage naturel et de l'intelligence artificielle. Il a stimulé la recherche sur les systèmes neuro-symboliques hybrides, qui combinent les réseaux neuronaux avec des mécanismes de raisonnement explicites. Il a également influencé le développement d'ensembles de données de référence plus difficiles testant les capacités de raisonnement, tels que ceux exigeant une inférence multi-sauts ou la résolution de problèmes mathématiques. DROP reste un outil d'évaluation standard pour la compréhension de lecture et le raisonnement, et il est souvent inclus dans l'entraînement et l'évaluation des grands modèles de langage modernes.

Ensembles de données connexes et orientations futures

DROP fait partie d'une famille plus large d'ensembles de données de raisonnement qui incluent des tâches comme la transformation séquence à séquence, les modèles basés sur l'attention multi-têtes, et les approches d'apprentissage par curriculum. Alors que DROP se concentre sur le raisonnement discret sur du texte, les ensembles de données plus récents ont élargi le champ pour inclure le raisonnement visuel, le sens commun et la compréhension multimodale. Au début des années 2020, de nombreux grands modèles de langage de pointe sont évalués sur DROP dans le cadre de leurs évaluations générales de raisonnement, et l'ensemble de données continue d'être un point de référence pour mesurer les progrès en compréhension automatique.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:benchmark·reading-comprehension·reasoning·nlp
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique