TREC-6是自然语言处理中广泛使用的问题分类基准。它定义了六个粗粒度语义类别,问题被归入其中:缩写、实体、描述、人类、地点和数字。该数据集最初于1999年作为第六届文本检索会议(TREC-6)问答赛道的一部分引入,此后已成为评估将问题映射到这些类别的分类器的标准测试平台。
该任务通常被形式化为一个监督学习问题:给定一个问题字符串,系统必须输出六个标签之一。原始的TREC-6数据集包含5,452个训练问题和500个测试问题,其粗粒度标签源自一个包含50个类别的更细粒度层次结构。该基准常与TREC-10和TREC-11变体一起使用,但TREC-6特指六类粗粒度设置。研究人员已用它来比较基于特征的方法(如使用词汇和句法特征的支持向量机)与现代神经网络方法。
数据集与任务定义
TREC-6数据集源自TREC问答赛道的问题集合,该集合包括来自TREC-8和TREC-9语料库等问题来源的问题。每个问题被标注为六种粗粒度类型之一。例如,“法国的首都是什么?”属于地点,而“谁写了《哈姆雷特》?”属于人类。数字类别涵盖关于数量、日期和百分比的问题。实体类别包括关于特定对象的问题,如“最高的建筑是什么?”缩写类别处理诸如“NATO代表什么?”之类的问题,而描述类别则涵盖关于定义和解释的问题。
标准评估指标是测试集上的分类准确率。由于类别不平衡(实体和数字更频繁),准确率仍是主要报告的数字,但一些研究也报告了各类别的F1分数。按现代标准来看,该基准规模较小,但对于快速原型开发以及研究问题措辞对分类的影响仍然有用。
历史背景
TREC-6是美国国家标准与技术研究院(NIST)主办的TREC会议系列的一部分。问答赛道始于1999年的TREC-8,但TREC-6标签特指第六届TREC活动,该活动包含一个试点问答任务。粗粒度分类方案在后来几年被正式化,TREC-6数据集成为学术论文中的常见参考。早期系统依赖手工规则和统计分类器,通常使用词n-gram、词性标注和命名实体识别等特征。
方法与性能
TREC-6的经典方法包括使用带有词袋特征的支持向量机,其准确率约为80-85%。更复杂的方法融入了句法解析树和语义角色标注。随着深度学习的兴起,研究人员应用了卷积神经网络和循环网络,通常达到90-95%的准确率。transformer-based模型(如BERT)的引入将测试集准确率推高至97%以上,尽管数据集的规模较小意味着不同运行之间的方差可能很大。
一个值得注意的技术是使用数据增强来扩展训练集,因为5,452个问题相对有限。一些研究还使用了课程学习来按难度排序训练示例。该基准常被用作新架构的合理性检查,因为它轻量且训练快速。
与现代系统的关系
尽管TREC-6是一个简单的分类任务,但它作为更大问答流水线的一部分仍然具有相关性。现代大型语言模型能以近乎完美的准确率解决TREC-6,但该基准仍被用于评估分类器的可解释性以及测试对改写的鲁棒性。粗粒度类别也用于对话系统和信息检索中,以将查询路由到适当的处理器。
该基准因过于简单且未反映现实世界问题的复杂性而受到批评,但它仍作为基线在论文中被引用。TREC-6数据集是公开可用的,可从NIST网站或通过流行的机器学习库下载。