译自英文

MS MARCO是一个大规模数据集,用于机器阅读理解与段落排序,由微软于2016年推出。它包含真实的必应查询和人工生成的答案,作为信息检索和问答系统的基准。

MS MARCO(微软机器阅读理解)是微软于2016年推出的大规模数据集,用于机器阅读理解与段落排序任务。该数据集旨在解决早期问答基准的局限性,通过提供来自必应搜索引擎日志的真实用户查询、相关网页段落以及人工生成的自然语言答案来实现这一目标。其创建与公开发布使研究人员能够开发并评估大规模检索与理解文本的系统,从而弥合传统信息检索与基于深度学习的理解模型之间的差距。

MS MARCO中的每个样本包含一个真实的用户查询、一组经相关性判断的段落,以及(对于部分样本)一个人工撰写的答案。该数据集包含超过10万个原始问答任务的查询,并有一个更大的版本用于段落排序。发布的数据包括通过众包生成的相关性标签,答案由人工标注者撰写。MS MARCO已被广泛用作段落重排序、机器阅读理解以及开放域问答等任务的标准基准。

数据集结构

原始MS MARCO数据集根据所需答案的类型将查询分为三大类:实体类、数字类和段落风格类问题。对于段落排序任务,数据集提供了负样本(不相关段落)以及基于人工标注者判断的正标签。数据集被划分为训练集、验证集和测试集。随着时间的推移,微软发布了多个版本和衍生任务,包括对话式搜索子集(MS MARCO ConvSearch)和更大的段落排序集合。该数据集来源于真实搜索日志,其规模与真实性使其区别于早期的合成数据集。

基准任务

MS MARCO引入了多项标准评估任务。主要任务是段落重排序,即模型必须根据人工标签按与查询的相关性对一组检索到的段落进行排序。第二个主要任务是机器阅读理解(MaRC),即模型阅读单个相关段落并生成精确答案(一个文本片段)或产生一个抽象式的流畅答案。后来,还加入了全段落排序任务以及带额外上下文的问答任务。性能通常使用MRR(平均倒数排名)、nDCG(归一化折损累积增益)和召回率等指标来衡量。该基准推动了基于Transformer的检索系统的显著进步。

应用与影响

MS MARCO成为神经检索模型发展的基础资源。它被领先的研究团队频繁使用,包括麻省理工学院计算机科学与人工智能实验室斯坦福人工智能实验室等大学团队,以及谷歌深度思维Anthropic等工业实验室,用于微调大型语言模型和密集检索系统。利用该数据集开发的高级模型影响了搜索引擎和对话助手的设计,从词汇匹配转向语义嵌入和神经重排序流水线。该数据集的成功还促使其被整合到TREC(文本检索会议)轨道中,作为官方评估支柱。

持续相关性

MS MARCO也作为现代基准的前身,例如用于文档排序的MS MARCO,它提供了用于训练多向量模型(如ColBERT)的段落和文档向量。截至2024年,该数据集仍然是广泛引用和常用的基准,用于评估密集检索和阅读理解领域的新技术。许多当代检索系统,包括使用Transformer架构和预训练方法的系统,都在[拥有]排行榜上针对MS MARCO进行评估。其真实世界的基础继续支持领域偏移、数据低效和少样本学习方面的研究。

相关提示

该数据集的设计原则与OpenAIAnthropic等公司研究团队创建的其他大规模资源一致,尽管那些资源侧重于生成任务。其与段落和问答的相关性与神经网络训练、Azure基础设施中的主题重叠,并且也从亚马逊页面开放源代码,由员工机器人[省略。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·information-retrieval·question-answering·dataset
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史