BERT(Bidirectional Encoder Representations from Transformers,即Transformers双向编码器表示)是由Google于2018年10月发布的一种语言表示模型。它是Transformer架构在语言理解领域最早产生广泛影响的应用之一,其发布常被视为一个转折点,使基于Transformer的预训练成为自然语言处理领域的主导范式。
架构与训练
BERT仅使用了Transformer架构的编码器部分,这与后来GPT系列所采用的基于解码器的自回归设计形成对比。它通过两种自监督目标进行训练:掩码语言建模(masked language modeling),即随机隐藏句子中的部分单词,并要求模型利用上下文从两个方向预测这些单词;以及下一句预测(next-sentence prediction),即让模型判断一个句子是否在逻辑上承接另一个句子。这种双向训练方式使BERT能够同时利用前后文信息构建表示,这相较于早期的单向或浅层双向方法(如word2vec和ELMo)是一个显著优势。
BERT发布了多个版本,其中最主要的是BERT-base(1.1亿参数)和BERT-large(3.4亿参数)。以后来的标准衡量,这些模型的规模并不算大,但在当时已属庞大。Google公开了预训练权重,使研究人员能够以相对较少的任务特定数据对模型进行微调,以应用于问答、情感分析和命名实体识别等具体下游任务。
影响
发布之初,BERT在多项NLP基准测试中取得了最先进的结果,包括GLUE基准套件和SQuAD问答数据集,且往往以显著优势超越此前的方法。其“先预训练后微调”的范式迅速被学界和工业界广泛采纳,并直接影响了后续编码器及编码器-解码器模型的设计。Google自2019年起将BERT整合进其核心搜索排名系统,称其为多年来搜索相关性方面最重要的改进之一,尤其是在理解更长、更口语化的查询意图方面。
与生成式模型的传承关系
BERT的出现早于由大语言模型(如GPT-2和GPT-3及其后继者)主导的时代。由于其纯编码器、非生成式的设计,BERT无法像自回归模型那样生成开放式文本。尽管如此,BERT及其众多衍生模型(如RoBERTa、ALBERT和DistilBERT)在2020年代仍被广泛用于分类、检索和嵌入等任务,这些场景不需要文本生成,而更注重效率。BERT风格的编码器也继续作为组件服务于更大的检索与语义搜索系统,包括作为某些检索增强生成流程的构建模块。Christopher Manning等学术界NLP研究者指出,BERT的发布是一个关键节点,证明了基于大规模无标注文本的自监督预训练可以超越主要依赖标注数据的方法,这一经验直接影响了后来生成式语言模型的扩展理念。