영어에서 번역됨

DeBERTa(디코딩 강화 BERT(Decoding-enhanced BERT)와 분리된 어텐션(disentangled attention))는 마이크로소프트가 개발한 트랜스포머 기반 언어 모델로, 분리된 어텐션과 향상된 마스크 디코더를 사용하여 BERT를 개선한 모델입니다. 이 모델은 2021년 SuperGLUE 벤치마크에서 최고 수준의 결과를 달성했습니다.

DeBERTa(解耦注意力增强的BERT)是一类用于自然语言处理(NLP)的Transformer神经网络架构家族,由微软研究人员于2021年提出。它在早期BERT模型的基础上引入了两项关键创新:一种解耦注意力机制,分别对内容信息和相对位置信息进行建模;以及一种增强的掩码解码器,在预训练阶段改进对掩码词元的预测。这些改进使DeBERTa在一系列NLP基准测试中取得了更优性能,包括在2021年1月首次在SuperGLUE排行榜上超越人类基线分数。

背景与动机

DeBERTa是大型语言模型更广泛演进过程中的一部分,这一演进始于2017年Transformer架构的提出。2018年,谷歌发布的BERT证明了在大规模文本语料上预训练双向Transformer编码器,能够为许多下游任务产生可迁移的表征。然而,BERT的注意力机制将词元位置编码为绝对位置嵌入并添加到输入中,这限制了其对更长序列或未见位置组合的泛化能力。DeBERTa通过将内容信息和位置信息解耦来解决这一问题,使模型能够学习到更灵活的词元间关系。

架构

DeBERTa保留了BERT的整体仅编码器结构,包括嵌入层、多层Transformer编码器层以及任务特定的输出头。其主要架构差异体现在注意力计算和掩码解码过程上。

解耦注意力

在标准Transformer注意力中,每个词元由一个同时包含内容信息和绝对位置信息的单一向量表示。DeBERTa则用两个独立的向量来表示每个词元:一个用于内容,一个用于相对位置。两个词元之间的注意力分数由四个不同项之和计算得出:内容到内容、内容到位置、位置到内容以及位置到位置。这种解耦机制使模型能够独立地捕捉语义关系和位置关系,特别有利于需要精细理解词序和词间距离的任务。

增强的掩码解码器

DeBERTa的预训练目标与BERT相同,均为掩码语言建模。然而,DeBERTa引入了一个增强的掩码解码器,在预测掩码词元时同时利用其内容信息和位置信息。具体而言,该解码器将掩码词元的绝对位置信息纳入解码层,这有助于模型在多个词元具有相似相对位置时消除歧义。增强的解码器提高了预训练效率,并带来了更好的下游任务性能。

训练与变体

DeBERTa与BERT使用相同的语料进行预训练,包括英文维基百科和BookCorpus,总计约16GB文本。基础模型DeBERTa-base包含12层、768个隐藏单元和12个注意力头,参数量约为1.4亿。更大的变体DeBERTa-large包含24层、1024个隐藏单元和16个注意力头,参数量约为4亿。2021年,微软还发布了DeBERTa-v3,引入了名为“替换词元检测”的新预训练方法,进一步提升了效率和性能。

性能与影响

DeBERTa在多个主要NLP基准测试中取得了最先进的结果。2021年1月,DeBERTa(大型模型并配合额外训练数据)在SuperGLUE基准上超越了人类基线,这一里程碑凸显了大型语言模型的快速进步。DeBERTa在GLUE基准和SQuAD问答数据集上也表现强劲。其创新影响了后续模型,包括GPT和T5系列中的部分工作,并为后来架构中更高效注意力机制的发展做出了贡献。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:natural-language-processing·deep-learning·transformer-architectures·language-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사