BERT 开源发布

译自英文

BERT(双向编码器表示来自变换器)是谷歌于2018年10月推出的预训练语言模型,基于变换器架构。它通过掩码语言建模和下一句预测学习上下文相关的词表示,显著推动了自然语言处理的发展。

BERT(来自Transformers的双向编码器表示)是一种语言模型,由谷歌研究人员于2018年10月提出。它通过自监督学习,采用仅编码器的Transformer架构,将文本表示为向量序列。BERT显著提升了大型语言模型的最新技术水平,截至2026年,它仍是自然语言处理(NLP)研究中常见的方法论组成部分。

BERT通过掩码词元预测和下一句预测进行训练,使其能够学习词元在其上下文中的上下文相关潜在表示,类似于ELMoGPT-2。它在许多NLP任务中得到了应用,例如指代消解和多义词消解。BERT在ELMo的基础上进行了改进,并催生了“BERT学”研究,该领域试图解释BERT所学到的内容。

架构

BERT是一种“仅编码器”的Transformer架构。从高层次来看,BERT由四个模块组成:分词器、嵌入模块、编码器堆栈和任务头。分词器将英文文本转换为整数序列(词元)。嵌入模块将词元转换为实值向量。编码器堆栈由具有自注意力但无因果掩码的Transformer块组成。任务头将最终表示向量转换为词元类型上的概率分布,充当解嵌入层。

任务头对于预训练是必需的,但对于问答或情感分类等下游任务通常不是必需的。对于此类任务,任务头会被移除,并替换为针对任务新初始化的模块,随后进行微调。潜在向量表示直接输入到该新模块中,从而实现样本高效的迁移学习。

嵌入

BERT的分词器是WordPiece,这是一种与字节对编码类似的子词策略。其词汇量为30,000,任何不在词汇表中的词元都会被替换为[UNK]。嵌入层包含三个组件:词元类型嵌入、位置嵌入和分段类型嵌入。词元类型嵌入根据词元类型将独热向量转换为稠密向量。位置嵌入使用绝对位置,每个维度由位置的正弦函数组成。分段类型嵌入使用0或1的词汇,指示词元属于第一个还是第二个文本段([SEP]特殊词元之后的词元为类型1)。三个嵌入向量相加,然后使用LayerNorm进行归一化,为每个词元输出一个768维向量。这些向量经过12个Transformer编码器块,并通过仿射变换解码回30,000维词汇空间。

架构家族

编码器堆栈有两个自由参数:L(层数)和H(隐藏大小)。自注意力头数始终为H/64,前馈/过滤器大小始终为4H。改变这些参数会产生一系列BERT模型。记法为L/H:BERTBASE为12L/768H,BERTLARGE为24L/1024H,BERTTINY为2L/128H。

训练

预训练

BERT同时在两个任务上进行预训练:掩码语言建模(MLM)和下一句预测(NSP)。在MLM中,BERT输入一个词序列,其中一个词可能被随机掩码,并预测原始词。这有助于BERT学习双向上下文,同时从两个方向理解词之间的关系。在NSP中,BERT被训练来预测一个句子是否逻辑上跟随另一个句子,这对于问答或文档分类等任务很重要。

#### 掩码语言建模

在掩码语言建模中,15%的词元被随机选择用于掩码预测任务。选中的词元以80%的概率被替换为[MASK]词元,以10%的概率被替换为随机词词元,并以10%的概率保持不变。这种策略避免了数据集偏移问题,即训练期间输入分布与推理期间不同的问题。

发布与影响

BERT最初以两种模型大小在英语中实现:BERTBASE(1.1亿参数)和BERTLARGE(3.4亿参数)。两者均在多伦多BookCorpus(8亿词)和英语维基百科(25亿词)上训练。权重在GitHub上发布,使模型广泛可访问。2020年3月11日,发布了24个较小的模型,最小的是BERTTINY,仅400万参数。

BERT的发布对自然语言处理领域产生了深远影响。它在广泛的任务上设定了新的基准,包括问答、情感分析和命名实体识别。其成功推广了预训练和微调范式,影响了后续模型,如GPT-2RoBERTa。BERT还激发了对可解释性的研究,“BERT学”作为一个领域出现,以理解模型学习到的内部表示。

应用与遗产

BERT的上下文嵌入已应用于众多任务,包括指代消解、多义词消解和机器翻译。其架构已被改编用于各种语言和领域,并且它仍然是许多NLP系统的基线。截至2026年,尽管出现了像GPT-3T5这样更大的模型,BERT仍然是NLP研究和行业应用中的基础工具。其影响体现在基于Transformer的模型的广泛采用以及大型语言模型的发展中。

BERT的发布还推动了高效模型变体的进展,例如DistilBERTALBERT,这些变体旨在降低计算成本同时保持性能。该模型的设计原则,包括掩码语言建模和下一句预测,已被纳入许多后续架构中,巩固了BERT作为现代NLP基石的遗产。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·transformer·google·machine-learning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史