Transformer-XL是一种基于Transformer的神经网络架构,由卡内基梅隆大学和谷歌深度思维的研究人员于2019年1月提出。它旨在解决标准Transformer的固定长度上下文限制,后者按段处理输入序列,并在段边界之外丢失信息。通过引入段级循环机制和相对位置编码方案,Transformer-XL能够建模比其前身更长的序列依赖关系,在发表时于多个语言建模基准上取得了最先进的结果。
该架构在论文《Transformer-XL:超越固定长度上下文的注意力语言模型》中提出,作者为Zihang Dai、Zhilin Yang、Yiming Yang、Jaime Carbonell、Quoc Le和Ruslan Salakhutdinov。模型名称源于其处理“超长”上下文的能力,其中“XL”代表超长。它作为开源软件发布,提供PyTorch和TensorFlow实现,并成为后续大型语言模型和序列处理系统的基础组件。
段级循环
Transformer-XL的核心创新是其段级循环机制,允许模型在处理当前段时重用先前段的隐藏状态。在标准Transformer中,每个段独立处理,模型的内存在每个段边界处重置,从而将上下文限制在段长度内。Transformer-XL则缓存前一段的隐藏状态,并将其作为附加上下文馈送到当前段的注意力层。
这种循环机制创建了一种跨段持续存在的记忆形式,使模型能够捕获跨越多个段的长距离依赖关系。例如,在语言建模中,较早段中引入的代词或主题可以在较晚段中正确解析,即使它们之间的距离超过段长度。循环在每个层应用,前一段的隐藏状态与当前段的状态在计算注意力之前进行拼接。
相对位置编码
第二个关键贡献是使用相对位置编码,取代了原始Transformer中使用的绝对位置编码。在标准Transformer中,每个标记的位置用固定向量编码,注意力分数基于绝对位置计算。当段被重用时,这种方法会失效,因为不同段中的相同标记会有不同的绝对位置,从而混淆模型。
Transformer-XL转而编码标记之间的相对距离,使模型能够泛化到训练期间未见过的更长序列。相对编码被集成到注意力计算中,为基于内容和基于位置的项分别设置可学习的参数。这种设计不仅解决了段重用问题,还提高了模型外推到更长上下文的能力,因为相对距离无论绝对位置如何都保持有意义。
性能与基准
Transformer-XL在多个语言建模数据集上显著优于先前的最先进模型。在WikiText-103基准上,它将困惑度从20.5(先前最佳模型达到)降至18.3,取得了显著提升。在enwik8数据集上,它实现了0.99的每字符比特数得分,优于早期的循环和卷积模型。它还在十亿词基准上表现良好,以21.8的困惑度创下新纪录。
模型处理长上下文的能力在需要记忆的任务中尤为明显,例如文本生成和文档级分类。其循环机制使其能够在数千个标记上保持连贯性,这是先前深度学习模型难以实现的能力。这些结果确立了Transformer-XL作为序列建模里程碑的地位,并影响了后续架构,包括现代生成式AI系统中使用的编码器-解码器模型。
影响与遗产
Transformer-XL的设计原则被后续模型采用和扩展。段级循环思想被纳入基于Transformer-XL的架构中,例如XLNet,后者将其与排列语言建模结合用于预训练。相对位置编码方案也成为许多后续Transformer变体的标准组件,包括OpenAI的GPT-2及后续模型,这些模型使用了简化版的相对注意力。
该架构对长距离依赖的关注促进了更高效注意力机制的发展,例如稀疏和滑动窗口注意力,旨在无需完全二次成本的情况下捕获长上下文。Transformer-XL还作为许多高效序列建模研究工作的基线,其开源实现促进了学术界和工业界的广泛采用。
技术细节与变体
Transformer-XL基于标准Transformer编码器-解码器框架构建,但通常用作仅解码器模型进行语言建模。循环机制应用于自注意力层,隐藏状态缓存大小是控制历史上下文量的超参数。模型使用层归一化、丢弃和梯度裁剪以保证训练稳定性,并采用Adam作为优化器。
提出了几种变体以提高效率,例如自适应注意力跨度,它学习每个头的最优上下文长度。该模型还启发了记忆增强Transformer的开发,其中使用外部记忆模块在极长序列上存储和检索信息。虽然Transformer-XL本身不再是当前最先进技术,但其贡献仍是现代序列模型设计不可或缺的一部分,其原理在高级机器学习课程中教授。
接受与应用
发布后,Transformer-XL因其强大的实证结果和概念清晰性而受到关注。它在语言建模和长距离序列处理文献中被广泛引用。该模型被应用于语言之外的任务,包括时间序列预测和音乐生成,这些任务中长距离依赖至关重要。其处理长达数千个标记序列的能力使其适用于文档级任务,例如摘要和问答,其中上下文跨越多个段落。
该架构还影响了高效推理系统的设计,因为循环机制允许对流式数据进行增量处理,而无需重新计算整个上下文。这一特性对实时应用(如语音识别和在线翻译)很有价值。尽管更新的架构(如具有稀疏注意力的大型语言模型)在规模和性能上已超越Transformer-XL,但其遗产在引入的基本技术中持续存在。
参见
参考文献
- Dai, Z., Yang, Z., Yang, Y., Carbonell, J., Le, Q., & Salakhutdinov, R. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- 官方实现和文档可在GitHub上获取。