掩码语言建模(MLM)是一种用于自然语言处理的自监督学习目标,其中模型被训练为根据周围上下文预测序列中随机掩码的标记。与传统的从左到右预测下一个标记的语言模型不同,MLM允许模型同时使用左右上下文,从而实现对语言的更深层次的双向理解。这种方法由基于Transformer的模型BERT(来自Transformer的双向编码器表示)推广,该模型由谷歌于2018年提出,并自此成为许多大型语言模型和深度学习系统的基石。
MLM的核心思想是通过将部分输入文本中的一些标记替换为特殊的[MASK]标记来破坏输入,然后训练模型重建原始标记。这迫使模型学习能够捕捉句法和语义关系的上下文表示。MLM是一种人工智能训练形式,不需要人工标注数据,使其非常适合在大型文本语料库上进行预训练,具有高度可扩展性。
历史背景
预测文本中缺失单词的概念源于早期的统计和神经模型,但MLM的现代形式随着深度学习的出现而兴起。2018年,Jacob Devlin及其在谷歌AI的同事提出了BERT,该模型使用MLM作为其主要预训练目标。BERT的成功表明,双向预训练可以显著提高各种自然语言处理任务(包括问答和情感分析)的性能。
在BERT之前,像ELMo这样的模型使用了双向LSTM,但并未以深层方式联合条件化两个方向。2017年由Vaswani等人提出的Transformer架构为BERT的双向注意力机制提供了基础。MLM成为区分BERT与早期单向模型(如GPT)的关键创新。
掩码语言建模的工作原理
在典型的MLM设置中,训练序列按以下步骤处理:
- 分词:使用分词器(例如WordPiece)将输入文本拆分为标记。
- 掩码:随机选择一部分标记(通常为15%)。对于每个选中的标记,有80%的概率将其替换为[MASK],10%的概率替换为随机标记,10%的概率保持不变。
- 预测:模型处理掩码序列,并为每个掩码位置输出词汇表上的概率分布。
- 损失:损失计算为预测分布与真实标记之间的交叉熵,并通过反向传播梯度来更新模型权重。
这种掩码策略,称为“带随机替换的掩码LM”,在BERT中引入,以缓解预训练(出现[MASK])和微调(不存在[MASK])之间的不匹配。
优势与局限性
MLM具有几个优势:
- 双向上下文:模型可以利用标记两侧的信息,从而获得更丰富的表示。
- 可扩展性:预训练可以在未标注文本上进行,使模型能够从大规模语料库中学习。
- 迁移学习:在下游任务上微调预训练的MLM模型通常能在有限标注数据下取得最先进的结果。
然而,MLM也存在局限性:
- 计算成本:训练需要大量计算资源,通常使用专用硬件,如AWS Trainium或Cerebras系统。
- 掩码效率低:每个训练步骤仅使用一小部分标记进行预测,使训练比自回归方法更不具样本效率。
- 预训练-微调不匹配:微调期间不存在[MASK]标记,可能导致分布偏移。
变体与改进
已提出多种MLM变体来解决其局限性:
- RoBERTa:由Facebook AI(现为Meta AI)开发,RoBERTa移除了下一句预测目标,并使用动态掩码,其中掩码模式在每个周期变化。它还使用更大的批次和更多数据进行训练。
- ALBERT:引入参数共享和句子顺序预测,以减少内存使用,同时保持性能。
- ELECTRA:使用替换标记检测任务,其中模型学习区分真实标记和生成器生成的替换标记,使训练更高效。
- 基于跨度的掩码:像SpanBERT这样的模型掩码连续的标记跨度,而不是单个标记,从而改善与跨度相关任务的性能。
这些变体已被各种大型语言模型采用,并影响了新架构的设计。
在现代AI中的应用
MLM不仅用于预训练通用语言模型,还用于领域特定模型。例如,BioBERT将MLM应用于生物医学文本,ClinicalBERT在临床笔记上进行训练。此外,MLM已扩展到其他模态,如通过掩码自编码器(例如用于图像的MAE)处理图像和音频。
在生成式AI的背景下,MLM通常用作混合模型中的组件,这些模型结合了双向和自回归目标,例如T5和BART,它们使用类似于MLM的去噪目标,但采用序列到序列架构。
与其他预训练目标的关系
MLM是机器学习领域中几种预训练目标之一。其他目标包括:
- 自回归建模:根据先前标记预测下一个标记(例如GPT)。这是单向的,并且是许多大型语言模型(如来自OpenAI的模型)的基础。
- 序列到序列去噪:像T5和BART这样的模型破坏输入并训练模型重建原始序列,这可以看作是MLM的广义形式。
- 对比学习:用于像SimCSE这样的模型中,通过将相似句子拉近并将不相似句子推远来学习句子嵌入。
MLM的双向特性使其特别适合需要理解完整上下文的任务,如命名实体识别和关系抽取。
对领域的影响
MLM与BERT的引入标志着自然语言处理领域的范式转变。它表明,在大型语料库上使用简单目标进行预训练可以产生能够很好地迁移到各种任务的表示。这导致了众多类似BERT的模型的开发,如DistilBERT、TinyBERT和MobileBERT,这些模型旨在减小模型大小,同时保持性能。
MLM还影响了其他领域中Transformer基础模型的设计,如计算机视觉(例如BEiT、MAE)和语音处理(例如wav2vec 2.0)。掩码和重建的概念已成为自监督学习中的一般原则。
未来方向
截至2025年,研究继续探索更高效和有效的预训练目标。一些方向包括:
- 统一模型:在单个模型中结合MLM和自回归目标,如UniLM和XLNet(使用排列语言建模)中的情况。
- 高效注意力:降低双向注意力的计算成本,使MLM能够在更长的序列上运行。
- 多模态MLM:将MLM扩展到联合建模文本、图像和音频,如CLIP和Flamingo等模型。
像谷歌DeepMind、OpenAI和Anthropic这样的公司继续投资于预训练研究,MLM仍然是其工具包中的基础技术。
结论
掩码语言建模已成为现代AI中的基础技术,使模型能够从未标注文本中学习丰富的双向表示。其与BERT在2018年的引入彻底改变了自然语言处理领域,并自此被适应到各种模态和架构中。尽管出现了更新的目标和模型,但MLM的掩码和重建原则继续影响着最先进系统的设计。随着领域的发展,MLM很可能仍然是开发更强大和高效AI模型的关键组成部分。