SuperGLUE基准测试

译自英文

SuperGLUE是2019年推出的一个包含八项具有挑战性的自然语言理解任务的基准测试套件,旨在取代GLUE基准,更准确地衡量通用语言理解系统的进展。它由纽约大学、DeepMind和华盛顿大学的研究人员共同提出。

SuperGLUE是一个用于评估自然语言理解(NLU)模型性能的基准测试套件。它于2019年发布,旨在接替早期的GLUE(通用语言理解评估)基准,后者因模型在其任务上接近或超过人类水平而趋于饱和。SuperGLUE提出了八个更具挑战性的任务,这些任务需要推理、常识知识和多句理解,旨在更稳健地衡量模型的通用语言能力。

该基准在一篇题为“SuperGLUE:通用语言理解系统的更粘性基准”的论文中引入,作者包括Alex Wang、Yada Pruksachatkun、Nikita Nangia、Amanpreet Singh、Julian Michael、Felix Hill、Omer Levy和Samuel R. Bowman。这项工作由纽约大学、DeepMind和华盛顿大学合作完成。其名称是对粘合剂品牌Super Glue的戏仿,反映了其作为“更粘性”基准的用途,即模型更难解决。

任务与评估

SuperGLUE包含八个任务,每个任务针对语言理解的不同方面:

  • BoolQ(布尔问题):根据短文回答是/否问题。
  • CB(承诺库):判断前提与假设之间是蕴含、矛盾还是中性关系。
  • COPA(合理替代选择):根据前提从两个选项中选择更合理的因果或结果。
  • MultiRC(多句阅读理解):回答关于文章的多项问题,每个问题有多个可能答案。
  • ReCoRD(带常识推理的阅读理解):使用常识推理填补新闻文章中的掩蔽实体。
  • RTE(识别文本蕴含):结合多个早期数据集的二元蕴含任务。
  • WiC(上下文中的词):判断一个词在两个不同句子中是否具有相同含义。
  • WSC(Winograd模式挑战):解决为简单统计模型设计的歧义句子中的代词指代。

每个任务都有特定指标:BoolQ、CB、COPA、RTE和WSC使用准确率;MultiRC和ReCoRD使用F1分数;WiC使用准确率。SuperGLUE总分是各任务分数的平均值,每个任务权重相等。

动机与设计

GLUE基准于2018年发布,已成为评估通用语言模型的标准。然而,到2019年初,BERT及其变体等模型在GLUE上的得分接近或超过估计的人类基线,使得模型之间的区分变得困难。SuperGLUE旨在通过包含更具挑战性且需要更深推理的任务来解决这一饱和问题,例如涉及常识知识和因果推理的Winograd模式挑战和COPA。

这些任务选自当时被认为对当代模型过于困难的现有数据集。作者还引入了一个新数据集ReCoRD,该数据集专门为基准创建。评估框架包括一个公开排行榜,允许研究人员将他们的模型与标准指标集和人类表现基线进行比较。

影响与反响

SuperGLUE迅速成为Natural language processing社区广泛使用的基准。它被主要研究团体和公司采用,包括OpenAIGoogle DeepMindMicrosoft (AI),作为新架构和训练方法的标准测试平台。该基准在Transformer (architecture)模型的发展中发挥了重要作用,特别是在Large language model时代。

2019年发布后不久,BERT-large和XLNet等模型得分达到70多分,而人类基线估计为89.8。到2021年,T5和DeBERTa等模型超过了人类基线,其中DeBERTa在2021年1月达到90.8分。这种快速进展导致许多人认为该基准已被“解决”,促使创建更难的基准,如SuperGLUE的继任者BIG-bench,以及后来的HELM基准。

尽管取得了成功,SuperGLUE也面临批评。一些研究人员认为,这些任务虽然具有挑战性,但仍未完全捕捉现实世界语言理解的复杂性,基准上的高分不一定转化为实际应用中的稳健性能。其他人指出,该基准仅关注英语任务,限制了其在多语言环境中的适用性。

遗产与继任者

SuperGLUE的遗产有两方面。首先,它展示了创建逐步更难基准以推动Artificial intelligence研究的价值。其次,它突显了Machine learning的快速进展,模型在短短两年内从低于人类表现发展到高于人类表现。该基准的设计原则,即使用多样化任务、清晰指标和公开排行榜,已被后续基准采用,如GLUE的继任者、SuperGLUE自身的继任者以及更广泛的评估生态系统。

原始GLUE基准于2021年退役,SuperGLUE的排行榜于2022年冻结,因为模型持续改进。然而,这些任务和数据集仍用于研究和开发,该基准在学术论文和行业报告中仍被引用,作为语言理解评估的里程碑。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·benchmark·evaluation·machine-learning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史