O transformer é uma família de arquiteturas de redes neurais artificiais usadas em aprendizado profundo, baseadas no mecanismo de atenção multi-cabeça. Dados de entrada, como texto, imagens ou áudio, são convertidos em uma sequência de representações numéricas chamadas tokens, cada um mapeado para um vetor por meio de uma tabela de incorporação de palavras. Em cada camada, cada token é contextualizado dentro da janela de contexto usando atenção multi-cabeça paralela, amplificando tokens importantes e diminuindo os menos relevantes. Como a autoatenção sozinha é invariante a permutações, os transformers injetam informações posicionais por meio de codificações posicionais ou incorporações aprendidas, de modo que a ordem dos tokens afeta a saída.
Os transformers não possuem unidades recorrentes, exigindo menos tempo de treinamento do que arquiteturas recorrentes anteriores, como LSTM. Os designs modernos são agrupados em variantes somente-codificador, somente-decodificador e codificador-decodificador, otimizadas para aprendizado de representações, geração autorregressiva ou tarefas condicionais de sequência para sequência. O transformer original foi proposto no artigo de 2017 "Attention Is All You Need" por pesquisadores do Google. Desde então, tornou-se a base dos modelos de linguagem de grande porte (LLMs) e encontrou aplicações em processamento de linguagem natural, visão computacional, aprendizado por reforço, áudio, aprendizado multimodal, robótica e xadrez.
História
Predecessores
Por muitos anos, a modelagem de sequências usava redes neurais recorrentes (RNNs) simples, como a rede de Elman (1990). Em teoria, a informação de um token poderia se propagar arbitrariamente longe, mas o problema do gradiente desaparecente deixava sequências longas sem informações extraíveis precisas. Um avanço fundamental foi a LSTM, descrita em um relatório técnico de 1995 e formalmente publicada em 1997, que introduziu mecanismos de portão para mitigar gradientes desaparecentes. A LSTM usava unidades de portão multiplicativas, conceitualmente distintas da atenção aditiva. Tornou-se o padrão para modelagem de sequências longas até 2017, mas as RNNs processam tokens sequencialmente, impedindo a paralelização. O controlador de pesos rápidos com escala linear (1992) aprendia a calcular matrizes de pesos com base na entrada, equivalente a um transformer linear não normalizado.
Atenção com seq2seq
A transdução de sequências codificador-decodificador desenvolveu-se no início dos anos 2010, com dois artigos concorrentes de 2014. Um modelo de 380M de parâmetros usava duas LSTMs para tradução automática: uma LSTM codificadora transformava uma sequência de tokens em um vetor, e uma LSTM decodificadora convertia-o em saída. Outro modelo de 130M de parâmetros usava unidades recorrentes com portão (GRUs), posteriormente mostradas como comparáveis às LSTMs. Esses primeiros modelos seq2seq careciam de atenção, dependendo de um vetor de estado de tamanho fixo após a última palavra, o que preservava mal informações longas de entrada. Reverter a frase de entrada melhorou a tradução, destacando o gargalo. O modelo de busca RNN introduziu atenção ao seq2seq, permitindo melhor tratamento de dependências longas. Em 2016, o Google Translate foi reformulado para Google Neural Machine Translation, usando um modelo seq2seq LSTM bidirecional de 8 camadas, superando métodos estatísticos.
Paralelizando atenção
Modelos seq2seq com atenção ainda sofriam com a dificuldade de paralelização das redes recorrentes, limitando a aceleração por GPU. Em 2016, a atenção decomponível aplicou autoatenção a redes feedforward, alcançando implicação textual de última geração com menos parâmetros. O autor Jakob Uszkoreit suspeitou que atenção sem recorrência poderia ser suficiente para tradução, levando ao título "Attention Is All You Need".
Arquitetura
A arquitetura do transformer consiste em um codificador e um decodificador, cada um composto por camadas com autoatenção multi-cabeça e redes feedforward posicionais. O codificador processa a sequência de entrada em paralelo, enquanto o decodificador gera saída autorregressivamente, usando autoatenção mascarada para evitar vazamento de tokens futuros. Atenção multi-cabeça executa múltiplos mecanismos de atenção em paralelo, permitindo que o modelo foque em diferentes subespaços de representação. Codificações posicionais são adicionadas às incorporações de tokens para capturar a ordem. Normalização de camada e conexões residuais estabilizam o treinamento. O decodificador também usa atenção cruzada para atender às saídas do codificador.
Variantes
Somente-codificador
Modelos somente-codificador, como BERT, são otimizados para aprendizado de representações, produzindo incorporações de tokens contextualizadas úteis para tarefas de classificação e compreensão. Eles usam atenção bidirecional, vendo tanto o contexto à esquerda quanto à direita.
Somente-decodificador
Modelos somente-decodificador, como GPT, são projetados para geração autorregressiva, prevendo o próximo token dado os anteriores. Eles usam autoatenção mascarada e são a base da maioria dos LLMs modernos, treinados em grandes corpora de texto.
Codificador-decodificador
Modelos codificador-decodificador, como o transformer original, lidam com tarefas condicionais de sequência para sequência, como tradução e sumarização. O codificador processa a fonte, e o decodificador gera o alvo.
Aplicações
Transformers são usados em sistemas de IA generativa, incluindo LLMs como GPT e BERT, que foram adotados por empresas como OpenAI, Anthropic e Google DeepMind. Eles alimentam processamento de linguagem natural, visão computacional (transformers de visão), aprendizado por reforço, processamento de áudio, aprendizado multimodal, robótica e até programas de xadrez. Sua escalabilidade impulsionou avanços em hardware, com chips especializados como AWS Trainium e processadores de inferência da Groq.
Impacto
Transformers revolucionaram a inteligência artificial, permitindo sistemas pré-treinados que podem ser ajustados para diversas tarefas. Eles reduziram o tempo de treinamento em comparação com RNNs e permitiram tamanhos de modelo sem precedentes, levando a avanços na compreensão e geração de linguagem. A flexibilidade da arquitetura tornou-a a escolha padrão para muitas aplicações de IA, influenciando pesquisa e indústria.
Limitações e Futuro
Apesar do sucesso, transformers exigem computação quadrática no comprimento do contexto, tornando sequências longas caras. Pesquisadores estão explorando mecanismos de atenção linear e arquiteturas alternativas para resolver isso. Em 2025, transformers permanecem dominantes, mas inovações contínuas podem levar a designs mais eficientes.