XTREME(多语言编码器跨语言迁移评估)是一个基准套件,旨在评估多语言模型的跨语言泛化能力。它于2020年由Google Research的研究人员提出,提供了一个标准化框架,用于评估在资源丰富的语言上训练的模型如何将知识迁移到资源稀缺的语言。该基准涵盖40种语言,包含9项任务,分为三个类别:句子分类、序列标注和问答。XTREME已成为比较多语言模型的广泛采用标准,影响了后续基准如XTREME-R和GLUE-X。
该基准的创建是为了解决对多语言表示进行系统评估日益增长的需求,尤其是在基于Transformer的模型如多语言BERT和XLM-R开始出现时。其设计强调现实的跨语言场景,即模型在英语数据上进行微调,并在其他语言上无需额外训练即可评估。这种零样本迁移设置测试了模型学习语言无关特征的能力,这对多语言自然语言处理的实际应用至关重要。
任务组成
XTREME包含九项任务,涵盖广泛的语言能力。对于句子分类,它包括多语言亚马逊评论语料库(MARC),涉及六种语言的情感分析,以及跨语言自然语言推理(XNLI)任务,测试蕴含和矛盾推理。对于序列标注,它包括用于命名实体识别(NER)的Wikiann数据集和用于词性标注的通用依赖(UD)数据集,两者均涵盖多种语言。对于问答,它包括机器阅读理解(MLQA)和跨语言问答(XQuAD)数据集,要求从多种语言的段落中提取答案。此外,它还包括针对类型多样语言的TyDiQA-GoldP任务和用于释义识别的PAWS-X任务。
每项任务都设计为对最先进的模型具有挑战性但可行,评估指标根据任务类型定制,例如分类的准确率、序列标注的F1分数和问答的精确匹配。该基准提供统一的评分机制,平均所有任务的性能,允许直接比较不同模型。
语言覆盖
XTREME中的40种语言被选择为代表广泛的语言家族和文字,包括印欧语系、汉藏语系、亚非语系等。这种多样性确保基准不仅测试词汇迁移,还测试句法和形态泛化。语言范围从资源丰富的语言如英语、西班牙语和汉语,到资源稀缺的语言如约鲁巴语、基尼亚卢旺达语和维吾尔语。资源稀缺语言的纳入尤为重要,因为它突出了依赖大量单语数据的模型的局限性。
该基准还包括使用不同文字的语言,如阿拉伯语、印地语和泰语,这些对分词和表示提出了额外挑战。这种覆盖使XTREME成为评估数据增强和模型剪枝等技术在多语言环境中有效性的标准。
评估协议
XTREME的标准评估协议涉及两个主要阶段。首先,模型在大型多语言语料库上进行预训练,通常使用掩码语言建模等目标。其次,模型在英语训练数据上针对每项任务进行微调,然后在所有其他语言的相应测试集上进行评估。这种零样本迁移设置旨在模拟现实场景,其中许多语言的标记数据稀缺。
为确保公平比较,基准提供公开排行榜,包含来自各种模型的结果,包括Google DeepMind、OpenAI和学术机构的模型。排行榜跟踪每项任务的性能和总体平均值,使研究人员能够识别不同架构的优缺点。截至2023年,像XLM-RoBERTa-large和mT5这样的模型已取得强劲结果,但尚无模型在所有任务上达到人类水平。
影响与扩展
XTREME对跨语言学习领域产生了重大影响。它推动了对抗训练、语言特定适配器和更好分词策略等研究。该基准也已扩展到XTREME-R,增加了更多任务和语言,以及XTREME-UP,专注于以用户为中心的任务,如语音和图像理解。
批评者指出,XTREME的零样本设置可能无法完全反映现实性能,因为模型通常受益于少量目标语言数据。尽管如此,它仍然是评估多语言模型的基础工具,其任务在机器学习研究中经常使用。该基准的代码和数据集公开可用,促进了可复现性和进一步创新。
参见
- cross-lingual-transfer
- multilingual-model
- 自然语言处理
- benchmark-dataset