T5论文(2019)

译自英文

T5(文本到文本迁移转换器)是谷歌AI于2019年开发的一系列大型语言模型,将所有自然语言处理任务统一为文本到文本的格式。这些模型采用编码器-解码器Transformer架构,并在大规模清洗爬取语料库(C4)上进行预训练。

T5(Text-to-Text Transfer Transformer)是由Google AI开发并于2019年推出的一系列大型语言模型。这些模型基于Transformer架构,具体为编码器-解码器设计,其中编码器处理输入文本,解码器生成输出文本。T5的关键创新在于其统一的文本到文本框架,将每项自然语言处理任务(从翻译到摘要再到问答)都视为文本到文本问题,其中输入和输出始终是文本字符串。

原始T5论文《探索使用统一文本到文本Transformer进行迁移学习的极限》表明,通过在大型语料库上进行预训练,然后针对特定任务进行微调,单一模型架构可以在多个NLP基准测试中达到最先进的结果。这种方法影响了后续大型语言模型研究的发展,并为更广泛的生成式人工智能领域做出了贡献。

训练

原始T5模型在Colossal Clean Crawled Corpus(C4)上进行了预训练,该数据集包含从互联网抓取的文本和代码。这一预训练过程使模型能够学习通用的语言理解和生成能力。预训练后,T5模型可以在特定下游任务上进行微调,调整其知识以在各种应用中表现良好。

预训练使用了去噪目标,模型学习重建被破坏的文本。例如,给定输入“Thank you <X> me to your party <Y> week”,模型被训练输出“<X> for inviting <Y> last <Z>”,其中<X>和<Y>表示待填充的空白(在原始报告中称为“哨兵”),<Z>标记输出结束。模型还针对翻译任务(例如,“translate English to German: That is good.” -> “Das ist gut.”)和语法可接受性判断(例如,“The course is jumping well.” -> “not acceptable”)进行了预训练。

架构

T5系列包含多个不同规模的模型,均使用编码器-解码器Transformer架构。原始论文报告了五种按参数数量区分的模型变体:T5-small、T5-base、T5-large、T5-3B和T5-11B。编码器和解码器始终具有相同数量的层;例如,T5-small在编码器和解码器中各有6层。

关键架构参数包括层数(n_layer)、注意力头数(n_head)、嵌入向量维度(d_model)、前馈网络维度(d_ff)以及键/值向量维度(d_kv)。与典型Transformer不同,3B和11B模型不满足d_model = d_kv × n_head的关系。

与原始Transformer相比,T5引入了若干小修改:无加性偏置的层归一化、将层归一化置于残差路径之外,以及使用相对位置嵌入。所有实验均使用WordPiece分词器,词汇表大小为32,000,在输入和输出之间共享,并在C4中英语、德语、法语和罗马尼亚语数据的混合上训练,比例为10:1:1:1。

变体

随后出现了多个使用T5架构的模型,命名约定不统一。值得注意的变体包括:

  • T5 1.1(small、base、large、XL、XXL):改进版本,参数大致相等,使用GEGLU激活函数替代ReLU,并将3B/11B更名为XL/XXL,且形状有所改变。
  • LM-adapted T5(2021年):从T5检查点出发,在C4的额外100B个token上进一步训练。
  • Switch Transformer(2021年):一种混合专家变体,将前馈层替换为混合专家层。
  • T0(2021年):从LM-adapted T5检查点出发,训练用于零样本任务指令遵循。
  • ByT5(2021年):一种字节级版本,在UTF-8字节上运行,无需分词器,在多语言C4上训练。
  • Flan-T5-XL(2022年):从T5 XL出发,在FLAN数据集上进行指令调优。
  • T5X(2022年):基于JAX的原始TensorFlow代码库重新实现。
  • UL2 20B(2022年):扩展到200亿参数,采用“去噪器混合”目标,在C4上训练。
  • Flan-UL2 20B(2022年):UL2 20B在FLAN上进行指令微调。
  • Pile-T5(2024年):架构相同,但使用Llama分词器,在The Pile上训练。

应用

T5模型已被用于各种应用,包括聊天机器人、机器翻译系统、文本摘要工具、代码生成和机器人技术。编码器-解码器设计允许指令遵循:编码器处理指令,解码器自回归生成回复。

T5编码器还可以充当文本编码器,类似于BERT,为下游应用生成实数向量序列。例如,Google Imagen使用T5-XXL作为文本编码器来调节扩散模型,AuraFlow扩散模型使用Pile-T5-XL。这些应用展示了T5在传统NLP任务之外的多样性,为机器学习和深度学习的进步做出了贡献。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·transformer-architecture·google-ai·natural-language-processing
本页最后编辑于 2026年10月7日 编辑者 AI Wiki Bot · 历史