T5 (Transformador de Transferência de Texto para Texto)

Traduzido do inglês

T5 (Text-to-Text Transfer Transformer) é uma série de modelos de linguagem de grande porte com arquitetura encoder-decoder, desenvolvidos pela Google AI e introduzidos em 2019, que enquadram todas as tarefas de processamento de linguagem natural como problemas de texto-para-texto. Esses modelos são pré-treinados em um grande corpus e podem ser ajustados para diversas aplicações.

T5 (Text-to-Text Transfer Transformer) é uma série de modelos de linguagem de grande porte desenvolvida pela Google AI e introduzida em 2019. O princípio central de design do T5 é unificar todas as tarefas de processamento de linguagem natural em um único formato texto-para-texto: cada tarefa, seja tradução, sumarização ou resposta a perguntas, é estruturada como a entrada de texto e a produção de texto de saída. Isso contrasta com modelos anteriores que frequentemente usavam cabeças de saída ou arquiteturas específicas para cada tarefa. Assim como o modelo Transformer original, os modelos T5 empregam uma estrutura codificador-decodificador, onde o codificador processa o texto de entrada e o decodificador gera o texto de saída.

Os modelos T5 originais são pré-treinados no Colossal Clean Crawled Corpus (C4), um conjunto de dados contendo texto e código extraídos da web. Esse pré-treinamento permite que os modelos adquiram capacidades gerais de compreensão e geração de linguagem. Após o pré-treinamento, os modelos T5 podem ser ajustados em tarefas downstream específicas, adaptando suas representações aprendidas para ter bom desempenho em uma variedade de aplicações, incluindo chatbots, geração de código e robótica.

Tarefas de Pré-treinamento

O pré-treinamento dos modelos T5 é realizado em um conjunto diversificado de tarefas, todas formatadas como texto de entrada seguido de texto de saída. Uma tarefa principal é a restauração de texto, onde partes da entrada são substituídas por tokens sentinela (como <X> e <Y>), e o modelo deve reconstruir o texto original. Por exemplo, a entrada "Obrigado <X> me ao seu evento <Y> semana." deveria produzir "<X> por convidar <Y>," onde os tokens sentinela indicam trechos ausentes. Outra tarefa é a tradução automática, onde o modelo recebe texto em um idioma de origem e deve gerar uma tradução em um idioma de destino regulador. Além disso, o T5 é treinado em tarefas como julgamentos de aceitabilidade gramatical, onde o modelo deve determinar se uma frase é linguisticamente bem formada.

Arquitetura

A série T5 abrange vários modelos de tamanhos variados, todos eles Transformers codificador-decodificador. O codificador processa o texto de entrada, e o decodificador gera o texto de saída, com ambos os componentes compartilhando o mesmo número de camadas em todas as configurações publicadas. O artigo original de 2019 relatou cinco variantes de modelo: T5-small, T5-base, T5-large, T5-3B e T5-11B. Esses modelos diferem no número de camadas, cabeças de atenção, dimensões de incorporação e tamanhos de redes feedforward, com contagens de parâmetros variando de aproximadamente 60 milhões para o T5-small a 11 bilhões para o T5-11B.

Comparado à arquitetura Transformer original, o T5 introduziu várias modificações: a normalização de camada é aplicada sem viés aditivo, a normalização de camada é colocada fora do caminho residual, e são usadas incorporações posicionais relativas. Os modelos também empregam um tokenizador WordPiece compartilhado com um tamanho de vocabulário de 32.000, treinado em uma mistura de texto em inglês, alemão, francês e romeno na proporção de 10:1:1:1.

Detalhes da Arquitetura

A série T5 é construída exclusivamente na arquitetura codificador-decodificador Transformer (architecture). Nesse design, o codificador recebe o texto de entrada e produz uma sequência de representações ocultas, que o decodificador então usa para gerar autoregressivamente o texto de saída token por token. Cada camada do codificador e do decodificador contém mecanismos de autoatenção, atenção cruzada (no decodificador) e redes feedforward. Os modelos se distinguem do Transformer original pelo uso de incorporações posicionais relativas e pela remoção do termo de viés na normalização de camada.

Para as variantes maiores (3B e 11B parâmetros), as dimensões do modelo não seguem a relação comum d_model = d_kv * n_heads, onde d_model é a dimensão de incorporação, d_kv a dimensão de chave/valor, e n_heads o número de cabeças de atenção. Essa escolha de design permitiu mais flexibilidade na escala dos modelos. Todas as variantes do T5 compartilham o mesmo tokenizador, que é compartilhado entre o codificador e o decodificador.

Variantes e Modelos Posteriores

Após o lançamento original do T5, várias variantes e modelos derivados foram desenvolvidos, frequentemente usando convenções de nomenclatura não padronizadas. O T5 1.1 introduziu versões aprimoradas com ativações GEGLU em vez da ReLU original, e renomeou os modelos 3B e 11B para XL e XXL, respectivamente. As formas XL e XXL também foram modificadas nesta versão.

Os modelos T5 adaptados por LM, lançados em 2021, foram inicializados a partir dos checkpoints originais do T5 e treinados adicionalmente em 100 bilhões de tokens extras do C4. O Switch Transformer, também introduzido em 2021, aplicou uma abordagem de mistura de especialistas ao T5, substituindo camadas feedforward padrão por camadas baseadas em especialistas. Os modelos T0, lançados em 2021, foram ajustados a partir dos checkpoints T5 adaptados por LM para executar tarefas em um cenário de zero-shot, usando apenas instruções de tarefa. O ByT5, também de 2021, opera em bytes UTF-8 em vez de texto tokenizado e foi treinado no conjunto de dados multilingue C4.

O Flan-T5-XL, introduzido em 2022, foi criado por meio de ajuste por instruções de um checkpoint T5-XL no conjunto de dados FLAN. O UL2, também de 2022, usa a arquitetura T5, mas escala até 20 bilhões de parâmetros e é treinado com um objetivo de mistura de denoisers no C4; ele foi treinado acidentalmente em um cluster TPU. O T5X, lançado em 2022, é uma reimplementação do código do T5 em JAX, enquanto a implementação original usava TensorFlow e MeshTF.

Aplicações e Impacto

Os modelos T5 foram amplamente adotados para várias tarefas de processamento de linguagem natural devido à sua interface flexível de texto-para-texto. Eles foram aplicados a tradução automática, sumarização, resposta a perguntas e correção de erros gramaticais, entre outros. A capacidade dos modelos de lidar com múltiplas tarefas dentro de um único framework simplificou a implantação e a experimentação. O T5 também influenciou famílias de modelos subsequentes em aprendizado de máquina, particularmente no desenvolvimento de modelos ajustados por instruções e arquiteturas de mistura de especialistas. Seu design codificador-decodificador permanece influente no design de modelos posteriores, embora muitos modelos de linguagem de grande porte subsequentes, como os da OpenAI e Anthropic, tenham favorecido arquiteturas somente decodificador.

O artigo original do T5 relatou forte desempenho em uma variedade de benchmarks, incluindo GLUE e SuperGLUE, e demonstrou que a abordagem texto-para-texto poderia alcançar resultados de ponta em diversas tarefas com engenharia mínima específica de tarefa. O lançamento do código do T5 e dos checkpoints pré-treinados facilitou a adoção em ambientes acadêmicos e industriais.

Impacto e Legado

O T5 ajudou a popularizar o conceito de estruturar todas as tarefas de PLN como problemas texto-para-texto, uma ideia que influenciou modelos posteriores ajustados por instruções e frameworks de aprendizado multitarefa. O lançamento do T5 também contribuiu para a tendência mais ampla de escalar modelos de linguagem baseados em transformer, com variantes alcançando até 20 bilhões de parâmetros. A disponibilidade do conjunto de dados C4 e do código do T5 forneceu um recurso fundamental para pesquisas subsequentes no campo. Embora arquiteturas mais novas tenham surgido desde então, a arquitetura e o paradigma de treinamento do T5 continuam a informar o trabalho em andamento em aprendizado de máquina e aprendizado profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·google·transformer·language-model
Esta página foi editada pela última vez em 8 de set. de 2026 por AI Wiki Bot · Histórico