Reuters-21578是一个经典的文本分类基准数据集,包含来自路透社新闻服务(Reuters newswire service)于1987年发布的21,578篇新闻文章。数十年来,它一直是评估机器学习和信息检索算法的基石。该数据集附带标准的训练-测试划分,通常使用“ModApte”划分,其中保留9,603篇文档用于训练,3,299篇用于测试,同时丢弃部分具有多个主题或无主题的文档。每篇文章被分配一个或多个主题标签,这些标签来自135个类别,包括经济指标、企业收购和农产品。
该数据集源自Reuters-22173语料库,该语料库于1990年代为研究目的而编制。-21578版本旨在解决不一致问题,并提供更干净、更广泛采用的基准。它已在多个平台上托管,包括UCI机器学习库(UCI Machine Learning Repository)和各种学术课程网站,成为文本分类实验的事实标准。
历史背景与创建
Reuters-21578源自更大的路透社新闻故事集合,主要来自1987年。最初的编制是马萨诸塞大学(University of Massachusetts)及其他机构项目的一部分,旨在为评估信息检索系统提供真实语料库。完整数据集最初包含超过21,000篇文档,但预处理步骤移除了那些标签缺失或模糊的文档,最终形成今天使用的21,578篇文章。ModApte划分以研究人员David D. Lewis和Marc Ringuette命名,他们使用了技术报告作者的首字母缩写(ModApte),成为标准评估协议,确保研究之间的可比性。
数据集的结构遵循典型的新闻通讯格式,包括标题、正文以及日期和作者等元数据,尽管大多数评估集中在带主题标签的正文上。主题标签由路透社编辑手动分配,为分类任务提供了高质量的真实标签。
在机器学习中的基准作用
Reuters-21578在推动机器学习文本分类方面发挥了重要作用。1990年代末和2000年代初的早期工作使用该数据集比较朴素贝叶斯、支持向量机和决策树等算法。例如,Joachims在1998年的一项里程碑式研究表明,支持向量机在该基准上取得了优越性能,前10个类别的微平均F1分数约为0.86,而k近邻约为0.82,朴素贝叶斯约为0.72。这些结果帮助确立了SVM作为高维文本数据强大工具的地位。
研究人员还使用该数据集探索特征选择技术,如卡方统计和信息增益,这些技术通过减少噪声显著提高了分类准确性。数据集的中等规模和清晰的标签结构使其成为在扩展到更大语料库之前进行方法原型设计的理想选择。
对自然语言处理的影响
在更广泛的自然语言处理领域,Reuters-21578为早期神经网络模型提供了标准评估。预transformer架构,如用于文本的卷积神经网络(例如,Kim Yoon在2014年的模型)和循环网络,在该数据集上进行了测试以展示其有效性。例如,Kim在2014年关于CNN用于句子分类的论文报告了Reuters-21578上的微F1为0.872,略优于使用线性核的传统SVM(0.855)。这有助于激发深度学习在结构化文本分类中的兴趣。
后来,随着大型语言模型和微调方法的出现,Reuters-21578仍然是新架构的快速检查工具,尽管其规模较小限制了其用于早期阶段实验。该数据集通常用于基准测试嵌入技术和迁移学习,其中预训练模型在ModApte划分上进行微调。
数据特征与预处理
该数据集包含21,578篇文章,但并非所有文章都有完整文本。平均文档长度约为200个单词。标签不是互斥的;一个文档可以属于多个类别,例如“earn”和“acq”。在实践中,许多研究将问题转化为每个类别的二元分类,或专注于前10个最频繁的类别,这些类别覆盖了大多数文档。分布是偏斜的,其中“earn”类别约有3,776篇训练文档,而许多类别只有不到10个示例,这对稀有类分类提出了挑战。
预处理通常涉及分词、小写化、停用词移除和词干提取。该数据集通常用作二元或多标签分类任务,使用精确率、召回率和F1分数(微平均和宏平均)等指标。
遗产与持续使用
尽管出现了20 Newsgroups和AG News等更新的数据集,Reuters-21578仍然是理解基本文本分类问题的参考。它经常用于人工智能和信息检索的学术课程中,以教授学生如何构建和评估分类器。其历史重要性在文献中得到认可,经常在文本分类综述中被引用。
截至2020年代初,该数据集可免费用于研究目的,需适当引用原始来源。它还启发了衍生版本,如添加预处理或不同划分的Reuters-21578,但原始ModApte划分仍是最常见的基线。该基准的持久性凸显了其质量和标签的清晰性,使其成为可复现研究的持久工具。
参考文献与进一步阅读
研究人员通常引用David D. Lewis的技术报告“Reuters-21578 Text Categorization Test Collection, Distribution 1.0”(1997年),该报告描述了数据集的构建和预期用途。从历史角度看,Lewis和Ringuette在1992年的论文在概率分类器的背景下引入了ModApte划分。这些文档为数据集的来源提供了主要依据。
参见
- Machine learning用于应用于该数据集的算法。
- Neural network用于在其上测试的深度学习模型。
- Data Augmentation用于提高分类性能的方法。
总之,Reuters-21578是一个基础性数据集,塑造了文本分类领域,提供了一个稳定、文档完善的测试平台,继续为现代NLP研究提供信息。