译自英文

DeBERTa(解码增强型BERT,采用解缠注意力机制)是由微软开发的一种基于Transformer的语言模型,通过使用解缠注意力机制和增强型掩码解码器改进了BERT。该模型在2021年的SuperGLUE基准测试中取得了最先进的结果。

DeBERTa(解耦注意力增强解码器)是一种基于Transformer架构的神经网络模型家族,用于自然语言处理(NLP),由微软研究人员于2021年提出。它在早期BERT模型的基础上,引入了两项关键创新:解耦注意力机制,分别建模内容与相对位置信息;以及增强的解码器,用于改进预训练期间掩码标记的预测。这些改进使DeBERTa在多项NLP基准测试中取得了更优性能,包括在2021年1月的SuperGLUE排行榜上首次超越人类基线得分。

背景与动机

DeBERTa是大型语言模型更广泛演进的一部分,这一演进始于2017年Transformer架构的引入。谷歌于2018年发布的BERT证明了,在大规模文本语料上预训练双向Transformer编码器,可以为众多下游任务生成可迁移的表示。然而,BERT的注意力机制将标记位置编码为绝对嵌入并添加到输入中,这可能限制其泛化到更长序列或未见过的位置组合的能力。DeBERTa通过解耦内容与位置信息来解决这一问题,使模型能够学习标记之间更灵活的关系。

架构

DeBERTa保留了BERT的纯编码器整体结构,包含嵌入层、多层Transformer编码器以及任务特定的输出头。主要的架构差异体现在注意力计算和掩码解码过程上。

解耦注意力

在标准Transformer注意力中,每个标记由单个向量表示,该向量结合了其内容与绝对位置。DeBERTa则用两个独立的向量表示每个标记:一个用于内容,一个用于相对位置。两个标记之间的注意力得分随后由四个不同项之和计算得出:内容到内容、内容到位置、位置到内容以及位置到位置。这种解耦使模型能够独立捕获语义和位置关系,对于需要精细理解词序和距离的任务尤其有利。

增强掩码解码器

DeBERTa的预训练目标是掩码语言建模,与BERT类似。然而,DeBERTa引入了一个增强的掩码解码器,利用掩码标记的内容和位置信息来预测原始词。这是通过将掩码标记的绝对位置纳入解码层来实现的,有助于模型在多个标记共享相似相对位置时消除歧义。增强的解码器提高了预训练效率,并带来了更好的下游任务性能。

训练与变体

DeBERTa在与BERT相同的语料库上进行预训练,包括英文维基百科和BookCorpus,总计约16GB文本。基础模型DeBERTa-base包含12层、1024个隐藏单元和12个注意力头,总参数量约为1.4亿。更大的变体DeBERTa-large则包含24层、1024个隐藏单元和16个注意力头,参数量约为4亿。2021年,微软还发布了DeBERTa-v3,引入了一种称为替换标记检测的新预训练方法,进一步提升了效率和性能。

性能与影响

DeBERTa在多项主要NLP基准测试中取得了最先进的结果。2021年1月,具有大规模参数和额外训练数据的DeBERTa在SuperGLUE基准上超越了人类基线得分,这一里程碑凸显了大型语言模型的快速进步。DeBERTa在GLUE基准和SQuAD问答数据集上也表现出色。其创新影响了后续模型,包括GPT和T5系列,并为后来架构中更高效注意力机制的发展做出了贡献。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·deep-learning·transformer-architectures·language-models
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史