Traduit de l'anglais

MS MARCO est un jeu de données à grande échelle pour la compréhension de lecture automatique et le classement de passages, introduit par Microsoft en 2016. Il contient de vraies requêtes Bing et des réponses générées par des humains, servant de référence pour les systèmes de recherche d'informations et de réponse aux questions.

MS MARCO (Microsoft Machine Reading Comprehension) est un jeu de données à grande échelle introduit par Microsoft en 2016 pour les tâches de compréhension de lecture automatique et de classement de passages. Ce jeu de données a été conçu pour pallier les limites des référentiels antérieurs de questions-réponses en fournissant de véritables requêtes issues des journaux de recherche Bing, accompagnées de passages pertinents extraits de documents web et de réponses générées en langage naturel par des humains. Sa publication a permis aux chercheurs de développer et d'évaluer des systèmes capables de récupérer et d'interpréter du texte à grande échelle, comblant ainsi le fossé entre la recherche d'information traditionnelle et les modèles de compréhension basés sur l'apprentissage profond.

Chaque exemple de MS MARCO comprend une requête réelle d'utilisateur, un ensemble de passages jugés pertinents, et, pour un sous-ensemble d'exemples, une réponse rédigée par un humain. Le jeu de données initial contient plus de 100 000 requêtes pour la tâche de questions-réponses, ainsi qu'une version élargie destinée au classement de passages. Les données publiées incluent des étiquettes de pertinence issues du crowdsourcing et des réponses rédigées par des annotateurs humains. MS MARCO est largement utilisé comme référence standard pour des tâches telles que le reclassement de passages, la compréhension de lecture automatique et les questions-réponses en domaine ouvert.

Structure du jeu de données

Le jeu de données MS MARCO organise les requêtes en trois catégories principales selon le type de réponse attendu : les questions factuelles (entités), les questions numériques et les questions de type passage. Pour la tâche de classement de passages, le jeu de données fournit des exemples négatifs (passages non pertinents) et des étiquettes positives basées sur les jugements d'annotateurs humains. L'ensemble est divisé en sous-ensembles d'entraînement, de validation et de test. Au fil du temps, Microsoft a publié plusieurs versions et dérivés, notamment un sous-ensemble pour la recherche conversationnelle (MS MARCO ConvSearch) et une collection élargie pour le classement de passages. L'échelle et le réalisme du jeu de données, issus de journaux de recherche réels, le distinguent des ensembles de données synthétiques antérieurs.

Tâches de référence

MS MARCO a introduit plusieurs tâches d'évaluation standard. La tâche principale est le reclassement de passages, où un modèle doit ordonner un ensemble de passages récupérés en fonction de leur pertinence par rapport à la requête, en s'appuyant sur les jugements humains. La deuxième tâche majeure est la compréhension de lecture automatique, où un modèle doit générer une réponse exacte (un extrait) ou une réponse abstraite et fluide à partir d'un passage pertinent. Par la suite, une tâche de classement de documents complets et une tâche de questions-réponses avec contexte additionnel ont également été incluses. Les performances sont généralement mesurées à l'aide de métriques telles que le MRR (Mean Reciprocal Rank), le nDCG (Normalized Discounted Cumulative Gain) et le rappel. Ces références ont stimulé des avancées significatives dans les systèmes de récupération basés sur les transformeurs.

Applications et impact

MS MARCO est devenu une ressource fondamentale pour le développement de modèles de récupération neuronale. Il est fréquemment utilisé par des groupes de recherche de premier plan, notamment dans des universités comme le MIT CSAIL et le Stanford AI Lab, ainsi que par des laboratoires industriels tels que Google DeepMind et Anthropic, pour l'optimisation de grands modèles de langage et de systèmes de récupération dense. Les modèles avancés développés à partir de ce jeu de données ont influencé la conception des moteurs de recherche et des assistants conversationnels, en déplaçant l'approche de la correspondance lexicale vers des plongements sémantiques et des pipelines de reclassement neuronaux. Le succès de MS MARCO a également conduit à son intégration dans les pistes officielles de la conférence TREC (Text Retrieval Conference) comme référence d'évaluation.

Pertinence continue

MS MARCO a également servi de précurseur à des référentiels modernes tels que le classement de documents, en fournissant des vecteurs de passages et de documents pour l'entraînement de modèles multi-vecteurs comme ColBERT. En 2024, le jeu de données reste largement cité et utilisé comme référence pour évaluer de nouvelles techniques en récupération dense et en compréhension de lecture. De nombreux systèmes de récupération contemporains, y compris ceux qui reposent sur des architectures de transformeurs et des méthodologies de pré entraînement, sont évalués sur MS MARCO dans les classements publics. Son ancrage dans des données réelles continue de soutenir la recherche sur les changements de domaine, l'inefficacité des données et l'apprentissage en quelques exemples.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·information-retrieval·question-answering·dataset
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique