MS MARCO(Microsoft Machine Reading Comprehension)是微软于2016年推出的大规模数据集,用于机器阅读理解与段落排序任务。该数据集旨在弥补早期问答基准的不足,通过提供来自必应搜索引擎日志的真实用户查询、网页文档中的相关段落以及人工生成的自然语言答案来实现这一目标。其创建与公开发布使研究人员能够开发并评估大规模文本检索与理解系统,从而弥合了传统信息检索与基于深度学习的理解模型之间的差距。
MS MARCO中的每个样本包含一条真实用户查询、一组经过相关性判断的段落,以及(针对部分子集)一条人工撰写的答案。该数据集包含超过10万条查询,用于原始问答任务,并有一个更大的版本用于段落排序。发布的数据包括通过众包方式生成的相关性标签,答案则由人工标注者撰写。MS MARCO已被广泛用作段落重排序、机器阅读理解以及开放域问答等任务的标准基准。
数据集结构
原始MS MARCO数据集根据所需答案的类型将查询分为三个主要类别:实体型、数值型和段落型问题。对于段落排序任务,数据集提供了负例(不相关段落)和基于人工标注者判断的正例标签。数据集被划分为训练集、验证集和测试集。随着时间的推移,微软发布了多个版本并衍生出相关任务,包括对话式搜索子集(MS MARCO ConvSearch)和更大的段落排序集合。该数据集来源于真实搜索日志,其规模与真实性使其区别于早期的人工合成数据集。
基准任务
MS MARCO引入了多项标准评估任务。主要任务是段落重排序,即模型需要根据人工标签的相关性对一组检索到的段落进行排序。第二个主要任务是机器阅读理解(MaRC),模型需阅读单个相关段落并生成精确答案(片段)或抽象流畅答案。后来还增加了全段落排序任务以及带附加信息的问答任务。性能通常使用MRR(平均倒数排名)、nDCG(归一化折损累积增益)和召回率等指标进行衡量。该基准显著推动了基于Transformer的检索系统的发展。
应用与影响
MS MARCO成为神经检索模型发展的基础资源。它被领先的研究团队广泛使用,包括mit-csail和stanford-ai-lab等高校机构,以及google-deepmind和anthropic等工业实验室,用于微调large language model和密集检索系统。利用该数据集开发的先进模型影响了搜索引擎和对话助手的设计,推动其从词汇匹配转向语义嵌入和神经重排序流程。该数据集的成功还促使其被纳入TREC(文本检索会议)的官方评测轨道。
持续相关性
MS MARCO还作为现代基准的前身,例如用于文档排序的MS MARCO版本,为训练多向量模型(如ColBERT)提供了段落和文档向量。截至2024年,该数据集仍是评估密集检索与阅读理解新技术时被广泛引用和使用的基准。许多当代检索系统,包括使用transformer架构和pretraining方法的系统,都在MS MARCO排行榜上进行评估。其真实世界的数据基础持续支持着领域迁移、数据低效和少样本学习等研究方向。
相关提示
该数据集的设计原则与其他大规模资源一致,这些资源由openai和anthropic等公司的研究团队创建,尽管后者更侧重于生成任务。MS MARCO与段落和问答任务的相关性也涉及neural-network训练、azure基础设施等领域,并同样来源于亚马逊页面的开源内容,其机器人技术[省略。