文本到文本框架

译自英文

文本到文本框架是自然语言处理中的一种统一方法,它将每个任务都转化为文本到文本的问题,这一方法由谷歌AI在2019年推出的T5模型所推广。

文本到文本框架是一种在自然语言处理中的方法论,它将所有任务重新表述为统一格式:给定输入文本,模型生成输出文本。这种方法由T5(文本到文本迁移变换器)模型推广,该模型由谷歌AI于2019年提出。通过将翻译、摘要和问答等任务统一为单一的文本到文本范式,该框架简化了模型设计,并支持跨多样任务的迁移学习。

T5模型是编码器-解码器 变换器架构,其中编码器处理输入文本,解码器生成输出文本。这种设计遵循原始变换器模型,但融入了修改,如相对位置嵌入和位于残差路径外的层归一化。该框架的灵活性使其能够处理广泛的任务,从语法错误纠正到代码生成。

训练

原始T5模型在Colossal Clean Crawled Corpus(C4)上进行了预训练,这是一个从互联网抓取的大规模文本和代码数据集。预训练涉及去噪目标,模型学习重建被破坏的文本,使用哨兵标记来指示缺失的片段。例如,给定“Thank you <X> me to your party <Y> week.”,模型学习输出“<X> for inviting <Y> last <Z>”,其中<Z>表示输出结束。

预训练后,T5模型可以在特定下游任务上进行微调。微调使模型的通用语言理解适应于聊天机器人、机器翻译和文本摘要等应用中的良好表现。该框架的统一格式意味着微调数据也以输入-输出文本对的形式构建,使其易于应用于新任务。

架构

T5系列包括不同规模的模型,均共享编码器-解码器结构。原始论文报告了五种配置:small(6000万参数)、base(2.2亿)、large(7.7亿)、3B和11B。每个模型在编码器和解码器中具有相同数量的层;例如,T5-small在每侧有6层。关键架构维度包括注意力头数量、嵌入维度、前馈网络大小以及键/值维度。值得注意的是,3B和11B模型偏离了嵌入维度等于键/值维度与注意力头数量乘积的典型关系。

与原始变换器相比,T5使用无加性偏置的层归一化,将归一化置于残差路径之外,并采用相对位置嵌入。一个词汇量为32,000的WordPiece分词器在输入和输出之间共享,基于C4中的英语、德语、法语和罗马尼亚语混合数据训练。

变体

随后有几种模型基于T5架构构建,通常采用非标准化命名。原始模型(2019年)之后是T5 1.1(改进版本,使用GEGLU激活函数,并将较大规模重命名为XL/XXL)。LM适配T5(2021年)继续在额外C4令牌上训练。Switch Transformer(2021年)引入了专家混合变体。T0(2021年)专注于零样本指令跟随。ByT5(2021年)在字节级文本上操作,无需分词器。Flan-T5(2022年)增加了指令调优。UL2 20B(2022年)扩展到200亿参数,并使用混合去噪器目标。Pile-T5(2024年)使用Llama分词器,并在The Pile上训练。

应用

T5框架的编码器-解码器设计支持指令跟随:编码器处理指令,解码器自回归生成响应。T5编码器还可以作为其他模型的文本编码器,生成用于条件化的向量表示。例如,Google Imagen使用T5-XXL作为其文本编码器,AuraFlow使用Pile-T5-XL。这些应用展示了该框架在传统NLP任务之外的多样性。

文本到文本范式影响了后续大型语言模型的发展,强调了统一输入-输出格式在迁移学习和多任务训练中的优势。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·machine-learning·transformer-models·google-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史