DeBERTa(解耦增强的BERT)是一种基于Transformer架构的神经网络模型家族,用于自然语言处理(NLP),由微软的研究人员于2021年提出。它建立在早期的BERT模型基础上,引入了两个关键创新:解耦注意力机制,分别建模内容与相对位置信息;以及增强的解码器,用于改进预训练期间掩码标记的预测。这些改进使DeBERTa在多项NLP基准测试中取得了优异表现,包括在SuperGLUE排行榜上首次超越人类基线(2021年1月)。
背景与动机
DeBERTa是大语言模型演进的一部分,这一演进始于2017年Transformer架构的引入。2018年,谷歌发布的BERT证明了在大规模文本语料上预训练双向Transformer编码器,可以为下游任务生成可迁移的表征。然而,BERT的注意力机制将标记位置编码为绝对位置并直接加到输入中,这限制了模型对更长序列或未见位置组合的泛化能力。DeBERTa通过解耦内容与位置信息,使模型能够学习更灵活的标记间关系,从而解决了这一问题。
架构
DeBERTa保留了BERT的编码器-only整体结构,包括嵌入层、多层Transformer编码器以及任务特定的输出头。其主要架构差异体现在注意力计算和掩码解码过程上。
解耦注意力机制
在标准Transformer注意力中,每个标记由单个向量表示,该向量同时包含内容与绝对位置信息。DeBERTa则用两个独立向量分别表示每个标记的内容与相对位置。两个标记之间的注意力分数由四个独立项之和计算:内容到内容、内容到位置、位置到内容以及位置到位置。这种解耦设计使模型能够独立捕捉语义与位置关系,特别有利于需要精细理解词序和距离的任务。
增强的掩码解码器
DeBERTa的预训练目标与BERT相同,即掩码语言建模。然而,DeBERTa引入了一个增强的掩码解码器,该解码器在预测掩码词时同时使用掩码标记的内容与绝对位置信息。这一设计有助于模型在多个标记具有相似相对位置时消除歧义,从而提升预训练效率,并最终带来更好的下游任务性能。
训练与变体
DeBERTa与BERT使用相同的预训练语料,包括英文维基百科和BookCorpus,总计约16GB文本。基础模型DeBERTa-base包含12层、768个隐藏单元和12个注意力头,参数量约1.4亿。更大的变体DeBERTa-large包含24层、1024个隐藏单元和16个注意力头,参数量约4亿。2021年,微软还发布了DeBERTa-v3,引入了新的预训练方法、、替换标记检测,进一步提升了效率与性能。
性能与影响
DeBERTa在多项主要NLP基准测试中取得了最先进的结果。2021年1月,DeBERTa凭借更大的模型规模和额外训练数据,在SuperGLUE基准上超越了人类基线,这一里程碑凸显了大语言模型的快速发展。DeBERTa还在GLUE基准和SQuAD问答数据集上表现优异。其创新影响了后续模型,包括GPT和T5系列,并为更高效注意力机制的发展做出了贡献。