SpanBERT是2020年由卡内基梅隆大学和斯坦福人工智能实验室的研究人员提出的基于Transformer的神经网络架构的一种变体。它扩展了原始的BERT模型,专注于预测连续标记的整个跨度,而不是单个被掩码的标记。其核心创新在于两个训练目标:跨度掩码和跨度边界预测(SBP)。跨度掩码将一段随机连续的标记序列替换为单个[MASK]标记,迫使模型从周围上下文推断整个跨度。随后,SBP利用掩码跨度起始和结束位置的标记表示来预测内部标记,充分利用边界信息。这种设计使SpanBERT在处理需要理解多标记实体和关系的任务(如问答和共指消解)时特别有效。
架构与训练
SpanBERT保留了BERT的标准Transformer编码器架构,具有多层双向编码器。关键区别在于预训练数据的掩码策略。它不是随机掩码15%的单个标记,而是从几何分布(均值为3.8个标记)中采样一个跨度长度,并掩码整个连续块。跨度长度上限为10个标记。这种方法鼓励模型捕获较长序列内的依赖关系。模型使用与BERT相同的英文维基百科和BooksCorpus数据集进行训练,采用相同的掩码语言建模目标来处理掩码跨度,但增加了SBP损失。SBP目标利用跨度(掩码后)第一个和最后一个标记的隐藏状态来预测内部标记,有效教会模型使用边界信息重建内容。
跨度边界预测
跨度边界预测是SpanBERT引入的一项新颖辅助任务。对于每个掩码跨度,模型取跨度前一个标记和跨度后一个标记的输出表示。这两个向量被拼接并通过一个线性层来预测每个内部掩码标记。这迫使模型以捕获内部语义内容的方式编码跨度的边界。与BERT的掩码语言建模(独立处理每个标记)不同,SBP鼓励模型将跨度作为一个整体进行推理。这对于答案通常是连续文本跨度的问答任务,以及提及通常是多标记短语的共指消解任务特别有益。
性能与影响
SpanBERT在发布时在多个基准测试上取得了最先进的结果。在SQuAD 1.1和SQuAD 2.0问答数据集上,它优于BERT和RoBERTa等同期模型。它还在OntoNotes共指消解任务和TACRED关系抽取数据集上创下了新纪录。改进在需要跨度级推理的任务上最为显著,证实了跨度聚焦预训练的有效性。SpanBERT的方法影响了后续跨度表示学习的研究。它证明了掩码连续跨度并使用边界预测在某些下游任务中可以比标记级掩码更有效。该模型的代码和预训练权重已公开发布,促进了研究社区的采用。
与BERT和RoBERTa的比较
SpanBERT与BERT的主要区别在于其掩码策略和SBP的添加。BERT随机掩码单个标记,而SpanBERT掩码跨度。RoBERTa是另一种流行的变体,使用动态掩码并移除下一句预测目标,但仍掩码单个标记。SpanBERT的跨度掩码为捕获长距离依赖提供了更强的训练信号。在直接比较中,SpanBERT在跨度相关任务上始终优于BERT,并且在问答和共指消解上通常与RoBERTa相当或超过它,尽管使用了相似的训练数据规模。关键要点是,掩码粒度的选择对自然语言处理中的表示学习有显著影响。
应用与遗产
SpanBERT的架构已应用于问答和共指消解之外的多种机器学习任务。它已用于信息抽取,其中识别实体提及和关系通常需要跨度级预测。它也被改编用于生物医学文本挖掘,如提取药物-药物相互作用或基因-疾病关联。跨度掩码和边界预测的原则已被纳入其他模型,包括一些大型语言模型预训练流程。虽然SpanBERT本身不如生成式AI系统等更大模型广泛使用,但它仍是Transformer编码器演变中的一个重要里程碑。其对跨度级理解的关注为旨在改进结构化预测任务的更新模型设计提供了参考。截至2020年代中期,SpanBERT仍作为跨度相关基准的强基线在研究文献中被引用。
局限性
SpanBERT存在一些局限性。跨度掩码策略需要仔细调整跨度长度分布,SBP目标增加了计算开销。该模型还受限于Transformer的固定上下文窗口(通常为512个标记),这可能限制其处理超长文档的能力。此外,SpanBERT是仅编码器模型,因此不适用于文本生成。其在生成任务上的性能无法与基于解码器的模型相比。尽管存在这些限制,SpanBERT对跨度表示学习的贡献是持久的,它作为理解预训练目标权衡的宝贵参考点。