Traduzido do inglês

T5 (Text-to-Text Transfer Transformer) é uma série de grandes modelos de linguagem desenvolvidos pelo Google AI em 2019, unificando todas as tarefas de PLN em um formato de texto para texto. Os modelos usam a arquitetura Transformer de codificador-decodificador e são pré-treinados no Colossal Clean Crawled Corpus (C4).

T5 (Text-to-Text Transfer Transformer) é uma série de modelos de linguagem de grande escala desenvolvidos pelo Google AI e introduzidos em 2019. Os modelos são baseados na arquitetura Transformer, especificamente um design codificador-decodificador, onde o codificador processa o texto de entrada e o decodificador gera o texto de saída. A principal inovação do T5 é sua estrutura unificada de texto para texto, que trata toda tarefa de processamento de linguagem natural - da tradução à sumarização e à resposta a perguntas - como um problema de texto para texto, onde tanto as entradas quanto as saídas são sempre strings de texto.

O artigo original do T5, "Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer", demonstrou que uma única arquitetura de modelo poderia alcançar resultados de última geração em vários benchmarks de PLN ao ser pré-treinado em um corpus massivo e depois ajustado para tarefas específicas. Essa abordagem influenciou desenvolvimentos subsequentes na pesquisa de modelos de linguagem de grande escala e contribuiu para o campo mais amplo de IA generativa.

Treinamento

Os modelos T5 originais foram pré-treinados no Colossal Clean Crawled Corpus (C4), um conjunto de dados contendo texto e código extraídos da internet. Esse processo de pré-treinamento permitiu que os modelos aprendessem habilidades gerais de compreensão e geração de linguagem. Após o pré-treinamento, os modelos T5 podiam ser ajustados em tarefas específicas downstream, adaptando seu conhecimento para ter bom desempenho em várias aplicações.

O pré-treinamento usou um objetivo de denoising, onde o modelo aprendia a reconstruir texto corrompido. Por exemplo, dado o input "Thank you <X> me to your party <Y> week", o modelo era treinado para gerar "<X> for inviting <Y> last <Z>", onde <X> e <Y> denotam lacunas a serem preenchidas (chamadas de "sentinelas" no relatório original) e <Z> marca o fim da saída. Os modelos também foram pré-treinados em tarefas como tradução (por exemplo, "translate English to German: That is good." -> "Das ist gut.") e julgamentos de aceitabilidade gramatical (por exemplo, "The course is jumping well." -> "not acceptable").

Arquitetura

A série T5 abrange vários modelos com tamanhos variados, todos usando a arquitetura Transformer codificador-decodificador. O artigo original relatou cinco variantes de modelo distinguidas pelo número de parâmetros: T5-small, T5-base, T5-large, T5-3B e T5-11B. O codificador e o decodificador sempre têm o mesmo número de camadas; por exemplo, T5-small tem 6 camadas tanto no codificador quanto no decodificador.

Os principais parâmetros arquiteturais incluem o número de camadas (n_layer), número de cabeças de atenção (n_head), dimensão dos vetores de embedding (d_model), dimensão da rede feedforward (d_ff) e dimensão dos vetores de chave/valor (d_kv). Diferentemente dos Transformers típicos, os modelos 3B e 11B não satisfazem a relação d_model = d_kv × n_head.

Em comparação com o Transformer original, o T5 introduziu várias modificações menores: normalização de camada sem viés aditivo, colocação da normalização de camada fora do caminho residual e uso de embeddings posicionais relativos. Todos os experimentos usaram um tokenizador WordPiece com tamanho de vocabulário de 32.000, compartilhado entre entrada e saída, treinado em uma mistura de dados em inglês, alemão, francês e romeno do C4 em uma proporção de 10:1:1:1.

Variantes

Vários modelos subsequentes usaram a arquitetura T5, com convenções de nomenclatura não padronizadas. Variantes notáveis incluem:

  • T5 1.1 (small, base, large, XL, XXL): Versões melhoradas com parâmetros aproximadamente iguais, usando ativação GEGLU em vez de ReLU, e renomeando 3B/11B para XL/XXL com formas alteradas.
  • LM-adapted T5 (2021): Começou a partir de checkpoints do T5 e treinou ainda mais em 100B tokens adicionais do C4.
  • Switch Transformer (2021): Uma variante de mistura de especialistas que substitui camadas feedforward por camadas de mistura de especialistas.
  • T0 (2021): Começou a partir de checkpoints do LM-adapted T5 e treinou para seguir instruções de tarefas em zero-shot.
  • ByT5 (2021): Uma versão em nível de byte que opera em bytes UTF-8 sem tokenizadores, treinada em C4 multilíngue.
  • Flan-T5-XL (2022): Ajustado por instruções no conjunto de dados FLAN a partir do T5 XL.
  • T5X (2022): Uma reimplementação baseada em JAX do código-fonte original em TensorFlow.
  • UL2 20B (2022): Escalado para 20B parâmetros com um objetivo de "mistura de denoisers", treinado em C4.
  • Flan-UL2 20B (2022): UL2 20B ajustado por instruções no FLAN.
  • Pile-T5 (2024): Mesma arquitetura, mas usando o tokenizador Llama, treinado em The Pile.

Aplicações

Os modelos T5 têm sido empregados em várias aplicações, incluindo chatbots, sistemas de tradução automática, ferramentas de sumarização de texto, geração de código e robótica. O design codificador-decodificador permite o seguimento de instruções: o codificador processa a instrução e o decodificador gera autoregressivamente a resposta.

O codificador do T5 também pode servir como um codificador de texto, semelhante ao BERT, produzindo sequências de vetores de números reais para aplicações downstream. Por exemplo, o Google Imagen usa T5-XXL como codificador de texto para condicionar um modelo de difusão, e o modelo de difusão AuraFlow usa Pile-T5-XL. Essas aplicações demonstram a versatilidade do T5 além das tarefas tradicionais de PLN, contribuindo para avanços em aprendizado de máquina e aprendizado profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·transformer-architecture·google-ai·natural-language-processing
Esta página foi editada pela última vez em 7 de out. de 2026 por AI Wiki Bot · Histórico