译自英文

XLNet是一种用于自然语言处理的自回归Transformer模型,于2019年6月发布,作为对BERT的改进。它采用排列语言建模来捕捉双向上下文,在多种任务上取得了最先进的结果。

XLNet 是一种用于自然语言处理的人工智能模型,于2019年6月19日推出,采用自回归Transformer架构。它被设计为对BERT的改进,通过使用排列语言建模来捕捉双向上下文,从而解决了掩码语言建模的局限性。该模型拥有3.4亿参数,并在330亿词的语料库上进行训练,,在语言建模、问答和自然语言推理等任务上取得了最先进的成果。它根据Apache 2.0许可证发布,,使其可免费用于研究和商业用途。

XLNet属于更广泛的大型语言模型家族,,这些模型是经过海量文本语料库训练以理解和生成人类语言的神经网络系统。它的开发建立在深度学习以及Transformer架构的进步之上,,后者自2017年问世以来彻底改变了该领域。与早期以固定从左到右或从右到左顺序处理文本的模型不同,,XLNet引入了一种新颖的训练目标,,考虑句子所有可能的排列,,使其能够同时从左右上下文学习

架构

XLNet的核心创新是排列语言建模。在标准自回归建模中,,像“My dog is cute”这样的句子被分解为条件概率的乘积,,其中每个词在给定所有先前词的条件下进行预测:Pr(My) × Pr(dog|My) × Pr(is|My, dog) × Pr(cute|My, dog, is)。这种从左到右的顺序限制了模型利用未来上下文的能力。然而,,XLNet在训练期间会随机排列词的顺序。例如,,采用3-2-4-1的排列顺序,,模型先预测“is”,然后预测“dog”,再预测“cute”,最后预测“My”,每次均以该排列中已生成的词为条件。通过在所有可能的排列上进行训练,,模型学会了利用双向上下文,,类似于BERT,,但没有BERT所依赖的人工[MASK]标记

双流自注意力

为了实现排列语言建模,,XLNet使用了双流自注意力机制。第一流称为内容流,,使用标准因果掩码自注意力编码每个词的实际内容,,类似于典型的Transformer解码器。第二流称为查询流,,根据排列中已生成的内容来编码每个词的内容,,它使用掩码交叉注意力机制,,其中查询来自查询流,,键值对来自内容流。这种分离使模型能够在看不到自身内容的情况下预测一个词,,这对于排列目标至关重要。两个流在训练期间结合,,推理时仅使用内容流

##训练与性能

XLNet在包含330亿词的大型语料库上进行训练,,其中包括书籍、网页和其他来源的文本。训练过程使用排列语言建模目标,,模型为每个训练示例随机采样一个排列顺序。该模型的3.4亿参数使其在规模上与BERT-large相当,,但其训练目标使其在多个基准测试上取得了更好的性能。例如,,在测试跨多个任务的自然语言理解的GLUE基准上,,XLNet在大多数任务上优于BERT,,包括情感分析、问答和文本蕴含等任务。它还在SQuAD问答数据集和语言建模困惑度任务上取得了最先进的成果

XLNet的一个显著优势是其捕捉更长距离依赖的能力。由于它考虑所有排列,,模型可以学习原始句子中相距较远的词之间的关系,,即使它们在特定排列中相邻。这对于需要理解全局上下文的任务特别有用,,例如文档分类或共指消解

##与BERT的比较

BERT于2018年推出,,使用掩码语言建模目标,,其中一定百分比的输入标记被替换为[MASK],,模型被训练来预测原始标记。虽然有效,,但这种方法存在局限性:[MASK]标记在微调或推理期间不存在,,造成训练与部署之间的不匹配。此外,,BERT假设掩码标记彼此独立,,这并非总是成立。XLNet通过使用排列语言建模解决了这些问题,,它不依赖[MASK]标记,,并允许模型捕捉所有标记之间的依赖关系。这使得XLNet在训练和推理之间更加一致,,并能更准确地建模联合概率分布

然而,,排列方法也带来了计算成本。XLNet比BERT需要更多的训练时间,,因为它必须为每个训练示例处理多个排列。双流自注意力机制也增加了架构的复杂性。尽管存在这些成本,,性能上的提升使XLNet在其发布时成为许多NLP应用的热门选择

##影响与遗产

XLNet对机器学习领域和自然语言处理产生了重大影响,它证明了自回归模型能够匹配或超越掩码语言模型的性能,,同时提供了更合理的训练目标,其成功激发了进一步研究基于排列和排列等变的模型,许多后续模型,,如ELECTRA和T5,,都借鉴了XLNet的思想,,排列语言建模的概念也影响了后来大型语言模型的设计,尽管XLNet已被GPT-3和T5等更强大的模型所超越,,但它在生成式人工智能和基于Transformer的架构发展过程中仍然是一个重要的里程碑,其根据Apache 2.0许可证的开源发布也促进了AI研究的民主化,,使世界各地的研究人员和开发者能够使用和修改该模型

##参考文献

  • Yang, Z., Dai, Z., Yang, Y., Carbonell, J., Salakhutdinov, R., & Le, Q. V. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv preprint arXiv:1906.08237.
  • Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·transformer-models·deep-learning·language-models
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史