GLUE-ZH是一个基准测试套件,旨在评估模型在中文文本上的通用语言理解能力。它遵循英文GLUE(通用语言理解评估)基准的结构,将其任务和评估方法适配到中文。该基准提供一个单一的聚合分数,反映模型在一系列基础NLP任务上的表现,从而能够直接比较不同方法在中文自然语言处理中的效果。
该基准于2010年代末推出,是更广泛的多语言评估标准努力的一部分,旨在应对快速发展的深度学习和大型语言模型领域。原始GLUE基准由纽约大学和华盛顿大学的研究人员于2018年发布,而GLUE-ZH则作为社区驱动的适配版本出现,以满足对标准化中文NLP评估日益增长的需求。它由学术和工业研究团体组成的联合体开发,尽管没有公认的单一官方发布日期或论文,且该基准的确切构成在不同实现中有所差异。
任务构成
GLUE-ZH通常包含一组镜像英文GLUE套件但使用中文数据集的任务。常见任务包括:
- 句子级分类:诸如情感分析(例如,使用中文ChnSentiCorp数据集)和问答自然语言推理(例如,CMNLI数据集,即MultiNLI语料库的中文版本)等任务。
- 文本相似度:诸如中文语义文本相似度(STS-B)等任务,衡量两个句子在0到5尺度上的语义相似程度。
- 单句标注:诸如中文分词和词性标注等任务,由于中文词语之间没有空格,这些任务对中文NLP至关重要。
- 阅读理解:诸如CMRC2018(中文机器阅读理解)等任务,要求模型根据给定段落回答问题。
GLUE-ZH中的确切任务数量在不同版本间有所变化,一些实现仅包含五个任务,而其他实现则扩展到九个或更多。最常引用的配置包括七个任务,涵盖分类、相似度和推理。
评估方法
GLUE-ZH使用与英文GLUE基准类似的评分系统。每个任务都有特定的指标(例如,分类任务使用准确率,相似度任务使用皮尔逊相关性),最终GLUE-ZH分数是所有任务特定分数的平均值。这种聚合分数允许通过单一数字比较模型性能,简化了评估过程。
模型通常在零样本或微调设置下进行评估。在零样本设置中,模型在没有任何任务特定训练的情况下接受GLUE-ZH任务测试,这衡量了它们的通用语言理解能力。在微调设置中,模型在评估前使用每个任务的训练数据进行训练,这衡量了它们对特定下游任务的适应性。
历史背景与使用
GLUE-ZH在2010年代末和2020年代初Transformer模型兴起期间获得了突出地位。它被用于多篇研究论文和技术报告中,特别是那些关注中文预训练模型(如基于BERT的变体,例如BERT-wwm、RoBERTa-wwm)和ERNIE的研究。这些模型在GLUE-ZH上持续取得高分,到2021年,表现最佳的模型聚合分数超过80%。
该基准因其范围有限而受到批评,因为它主要关注句子级任务,不包括对话生成或文档级理解等更复杂的任务。此外,缺乏单一官方版本导致不同研究之间报告结果不一致,使得直接比较变得困难。
与其他基准的关系
GLUE-ZH是包括SuperGLUE(英文GLUE的继承者)和XTREME(跨语言基准)在内的多语言基准家族的一部分。虽然XTREME将中文作为众多语言之一,但GLUE-ZH为中文提供了更深入的评估。它也与中文SuperGLUE(CLUE)基准相关,后者于2020年发布,为中文NLP提供了更全面和标准化的评估套件。由于CLUE具有更大的任务集和官方排行榜,它在研究使用中已基本取代了GLUE-ZH。
当前状态
截至2020年代中期,GLUE-ZH在前沿研究中的使用频率降低,已被CLUE和中文版SuperGLUE等更全面的基准所取代。然而,它仍然是理解中文NLP评估演变的宝贵参考,并仍被一些教育材料和历史分析引用。该基准的影响在新评估套件的设计中持续存在,这些新套件通常纳入类似的任务类型和评分方法。