Traduzido do inglês

T5 (Text-to-Text Transfer Transformer) é uma série de modelos de linguagem de grande porte com arquitetura encoder-decoder, introduzidos pela Google AI em 2019, pré-treinados no conjunto de dados C4 e adaptáveis a diversas tarefas baseadas em texto.

T5 (Text-to-Text Transfer Transformer) é uma série de modelos de linguagem de grande porte desenvolvidos pelo Google AI e introduzidos em 2019. Como o modelo transformador original, os modelos T5 são transformadores codificador-decodificador, onde o codificador processa o texto de entrada e o decodificador gera o texto de saída. Os modelos T5 geralmente são pré-treinados em um conjunto massivo de dados de texto e código, após o que podem executar tarefas baseadas em texto semelhantes aos seus objetivos de pré-treinamento, e podem ser ajustados para outras tarefas. Eles foram aplicados em chatbots, tradução automática, sumarização de texto, geração de código e robótica.

Treinamento

Os modelos T5 originais foram pré-treinados no Colossal Clean Crawled Corpus (C4), contendo texto e código extraídos da internet. Esse pré-treinamento permite que os modelos aprendam compreensão e geração geral de linguagem. Os modelos T5 podem então ser ajustados em tarefas downstream. O pré-treinamento usou um formato texto-para-texto, onde cada tarefa é estruturada como <texto de entrada> -> <texto de saída>. Exemplos incluem restaurar texto corrompido (por exemplo, preencher lacunas marcadas por sentinelas), tradução (por exemplo, inglês para alemão) e julgamento de aceitabilidade gramatical (por exemplo, classificação de frases CoLA).

Arquitetura

A série T5 inclui modelos de tamanhos variados, todos transformadores codificador-decodificador. O artigo original relatou cinco modelos: T5-small (60M parâmetros), T5-base (220M), T5-large (770M), T5-3B (3B) e T5-11B (11B). Cada modelo tem o mesmo número de camadas no codificador e no decodificador; por exemplo, T5-small tem 6 camadas em cada. Dimensões arquiteturais-chave incluem o número de camadas, cabeças de atenção, dimensão de incorporação, dimensão de feedforward e dimensão de chave/valor. Diferente dos transformadores típicos, os modelos 3B e 11B não satisfazem a relação d_model = d_kv * n_head. Comparado ao transformador original, o T5 usa normalização de camada sem viés aditivo, coloca a normalização de camada fora do caminho residual e usa incorporações posicionais relativas. Um tokenizador WordPiece com tamanho de vocabulário de 32.000 foi usado, compartilhado entre entrada e saída, treinado em uma mistura de dados em inglês, alemão, francês e romeno do C4 em uma proporção de 10:1:1:1.

Variantes

Vários modelos subsequentes usaram a arquitetura T5. Variantes notáveis incluem:

  • T5 1.1 (2019-2020): Versões melhoradas com ativação GEGLU em vez de ReLU; os modelos 3B e 11B foram renomeados para XL e XXL com formas modificadas.
  • LM-adapted T5 (2021): Começou a partir de checkpoints T5 e treinou ainda mais em 100B tokens adicionais do C4.
  • Switch Transformer (2021): Uma variante de mistura de especialistas substituindo camadas feedforward por camadas de especialistas.
  • T0 (2021): Começou a partir do LM-adapted T5 e foi treinado para executar tarefas zero-shot com base em instruções.
  • ByT5 (2021): Versão em nível de byte operando em bytes UTF-8 sem tokenizadores, treinada em C4 multilíngue.
  • Flan-T5-XL (2022): Ajustado por instruções no conjunto de dados FLAN a partir do T5 XL.
  • T5X (2022): Uma reimplementação baseada em JAX do código original do T5 (não um modelo).
  • UL2 20B (2022): Escalado para 20B parâmetros, treinado com um objetivo de mistura de denoisers no C4; notavelmente treinado acidentalmente por um mês em um cluster de TPU.
  • Flan-UL2 20B (2022): UL2 20B ajustado por instruções no FLAN.
  • Pile-T5 (2024): Mesma arquitetura, mas usa o tokenizador Llama e é treinado no The Pile, disponível em tamanhos base, large, XL e XXL.

Aplicações

A estrutura codificador-decodificador do T5 permite seguir instruções: o codificador codifica a instrução, e o decodificador gera autoregressivamente a resposta. O codificador do T5 também pode servir como um codificador de texto, semelhante ao BERT, produzindo representações vetoriais para tarefas downstream. Por exemplo, o Google Imagen usa T5-XXL como seu codificador de texto, e o modelo de difusão AuraFlow usa Pile-T5-XL. Essas aplicações demonstram a versatilidade do T5 em IA generativa e além.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·transformer·google-deepmind·natural-language-processing
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico