BERT(来自Transformer的双向编码器表示)是一种语言表示模型,由Google于2018年10月发布。它是Transformer (architecture)架构最早产生广泛影响力的应用之一,其发布常被视为一个转折点,使基于Transformer的Pretraining成为Natural language processing中的主导范式。
架构与训练
BERT仅使用Transformer架构的编码器部分,这与后来GPT系列采用的基于解码器的自回归设计形成对比。它通过两个自监督目标进行训练:掩码语言建模,即句子中的随机单词被隐藏,模型需利用双向上下文进行预测;以及下一句预测,即模型学习一个句子是否合理地接续另一个句子。这种双向训练使BERT能够同时利用前后文信息构建表示,相比早期的单向或浅层双向方法(如word2vec和ELMo)具有优势。
BERT发布了多个版本,最著名的是BERT-base(1.1亿参数)和BERT-large(3.4亿参数),按后来的标准看规模适中,但在当时已属庞大。Google公开了预训练权重,使研究人员能够针对特定下游任务(如问答、情感分析和命名实体识别)对模型进行微调,且只需相对少量的任务特定数据。
影响
发布时,BERT在广泛的NLP基准测试中取得了最先进的结果,包括GLUE套件和SQuAD问答数据集,且往往大幅超越先前方法。其“先预训练后微调”的范式迅速被领域广泛采用,并直接影响了后续编码器和编码器-解码器模型的设计。Google从2019年开始将BERT整合到其核心搜索排名系统中,称其为多年来搜索相关性最显著的改进之一,尤其在理解较长、更对话式查询的意图方面。
相对于生成模型的遗产
BERT早于由GPT-2、GPT-3及其后继者定义的大语言模型时代,其仅编码器、非生成式设计意味着它无法像自回归模型那样生成开放式文本。尽管如此,BERT及其众多衍生模型(包括RoBERTa、ALBERT和DistilBERT)在2020年代仍被广泛用于分类、检索和嵌入任务,这些场景无需生成且注重效率。BERT风格的编码器继续作为更大检索和语义搜索系统的组件,包括作为某些检索增强生成流程的构建块。Christopher Manning等学术NLP研究者指出,BERT的发布是一个关键时刻,证明了对未标注文本的大规模自监督预训练能够超越主要依赖标注数据集的方法,这一经验直接延续到了后来生成式语言模型的扩展哲学中。