Artigo do Google Transformer

Traduzido do inglês

O artigo de 2017 do Google, 'Attention Is All You Need', introduziu a arquitetura transformer, um design de rede neural baseado em atenção multi-cabeça que substituiu unidades recorrentes, permitindo processamento paralelo e tornando-se a base para os modernos [[large language model|modelos de linguagem de grande escala]].

O transformer é uma família de arquiteturas de redes neurais artificiais baseada no mecanismo de atenção multi-cabeça. Nesse design, dados de entrada, como texto, imagens ou áudio, são convertidos em uma sequência de representações numéricas chamadas tokens, e cada token é convertido em um vetor por meio de uma consulta a uma tabela de incorporação de palavras. Em cada camada, cada token é contextualizado dentro do escopo da janela de contexto com outros tokens não mascarados por meio de um mecanismo de atenção multi-cabeça paralelo, permitindo que o sinal para tokens-chave seja amplificado e que tokens menos importantes sejam diminuídos. Como a autoatenção sozinha é invariante a permutações, os transformers injetam informações posicionais, tipicamente por meio de codificações posicionais ou incorporações posicionais aprendidas, de modo que a ordem dos tokens possa afetar a saída.

A arquitetura original do transformer foi proposta no artigo de 2017 "Attention Is All You Need" por pesquisadores do Google, incluindo Jakob Uszkoreit, Lukasz Kaiser e Niki Parmar. Este artigo marcou um afastamento das redes neurais recorrentes (RNNs), como a memória de longo prazo (LSTM), que dominavam a modelagem de sequências. Os transformers têm a vantagem de não possuir unidades recorrentes, exigindo, portanto, menos tempo de treinamento do que arquiteturas recorrentes anteriores, e desde então foram amplamente adotados para treinar grandes modelos de linguagem (LLMs) em grandes conjuntos de dados. Os designs modernos de transformers são comumente agrupados em variantes somente codificador, somente decodificador e codificador-decodificador, dependendo se são otimizados para aprendizado de representação, geração autorregressiva ou tarefas condicionais de sequência para sequência.

Predecessores e o Problema do Processamento Sequencial

Por muitos anos, a modelagem e a geração de sequências eram feitas usando redes neurais recorrentes simples. Um exemplo inicial bem citado foi a rede de Elman (1990). Em teoria, a informação de um token pode se propagar arbitrariamente ao longo da sequência, mas na prática o problema do gradiente desaparecente deixa o estado do modelo no final de uma frase longa sem informações precisas e extraíveis sobre tokens anteriores. Um avanço fundamental foi a LSTM, descrita originalmente em um relatório técnico de 1995 e formalmente publicada em 1997, que introduziu mecanismos de portão para mitigar o problema do gradiente desaparecente, permitindo o aprendizado eficiente de modelagem de sequências longas. Um elemento arquitetural-chave foi o uso de unidades de portão multiplicativas, nas quais as saídas de alguns neurônios modulam as saídas de outros. Essas unidades multiplicativas são conceitualmente distintas do mecanismo de atenção aditiva introduzido posteriormente para modelos de sequência para sequência. A LSTM tornou-se a arquitetura padrão para modelagem de sequências longas até a publicação dos transformers em 2017. No entanto, a LSTM ainda usava processamento sequencial, operando um token por vez, do primeiro ao último; elas não podem operar em paralelo sobre todos os tokens em uma sequência.

Os transformers modernos superam esse problema, mas, ao contrário das RNNs, exigem tempo de computação quadrático em relação ao tamanho da janela de contexto. O controlador de pesos rápidos de escala linear (1992) aprende a calcular uma matriz de pesos para processamento adicional dependendo da entrada. Uma de suas duas redes tem "pesos rápidos" ou "links dinâmicos" (1981). Uma rede neural lenta aprende por descida de gradiente a gerar chaves e valores para calcular as mudanças de pesos da rede neural rápida, que calcula respostas para consultas. Isso foi posteriormente demonstrado como equivalente ao transformer linear não normalizado.

Atenção com Modelos de Sequência para Sequência

A ideia de transdução de sequência codificador-decodificador foi desenvolvida no início dos anos 2010; comumente citados como originadores do seq2seq estão dois artigos publicados simultaneamente em 2014. Um modelo de 380M de parâmetros para tradução automática usa duas memórias de longo prazo. Sua arquitetura consiste em duas partes: o codificador é uma LSTM que recebe uma sequência de tokens e a transforma em um vetor, e o decodificador é outra LSTM que converte o vetor em uma sequência de tokens. Da mesma forma, outro modelo de 130M de parâmetros usou unidades recorrentes com portão (GRU) em vez de LSTM. Pesquisas posteriores mostraram que as GRUs não são nem melhores nem piores que as LSTMs para seq2seq.

Esses primeiros modelos seq2seq não tinham mecanismo de atenção, e o vetor de estado é acessível apenas após a última palavra do texto de origem ser processada. Embora em teoria tal vetor retenha informações sobre toda a frase original, na prática a informação é mal preservada. Isso ocorre porque a entrada é processada sequencialmente por uma rede recorrente em um vetor de saída de tamanho fixo, que é então processado por outra rede recorrente em uma saída. Se a entrada for longa, o vetor de saída não conseguiria conter todas as informações relevantes, degradando a saída. Como evidência, inverter a frase de entrada melhorou a tradução seq2seq.

O modelo de busca RNN introduziu um mecanismo de atenção ao seq2seq para tradução automática para resolver o problema do gargalo do vetor de saída de tamanho fixo, permitindo que o modelo processe dependências de longa distância mais facilmente. O nome se deve ao fato de que ele "emula a busca por uma frase de origem durante a decodificação de uma tradução". Os desempenhos relativos foram comparados entre arquiteturas de modelos de atenção global e local para tradução automática, descobrindo que a atenção mista tinha qualidade maior que a atenção global, enquanto a atenção local reduzia o tempo de tradução.

Em 2016, o Google Tradutor foi reformulado para o Google Neural Machine Translation, que substituiu o modelo anterior baseado em tradução automática estatística. O novo modelo era um modelo seq2seq em que o codificador e o decodificador eram ambos 8 camadas de LSTM bidirecional. Levou nove meses para ser desenvolvido e superou a abordagem estatística, que levou dez anos para ser desenvolvida.

Paralelizando a Atenção

Modelos seq2seq com atenção, incluindo autoatenção, ainda sofriam do mesmo problema com redes recorrentes: eles são difíceis de paralelizar, o que impedia sua aceleração em GPUs. Em 2016, a atenção decomponível aplicou um mecanismo de autoatenção a redes feedforward, que são fáceis de paralelizar, e alcançou resultados de última geração em implicação textual com uma ordem de magnitude a menos de parâmetros do que as LSTMs. Um de seus autores, Jakob Uszkoreit, suspeitou que a atenção sem recorrência seria suficiente para tradução de idiomas, daí o título "Attention Is All You Need".

A arquitetura do transformer introduzida no artigo de 2017 substituiu completamente as unidades recorrentes por atenção multi-cabeça, permitindo que todos os tokens fossem processados em paralelo. Essa paralelização possibilitou acelerações significativas no treinamento e levou ao desenvolvimento de sistemas pré-treinados, como transformers gerativos pré-treinados (GPTs) e BERT (representações de codificador bidirecional de transformers). Desde então, os transformers encontraram aplicações em processamento de linguagem natural em larga escala, visão computacional (transformers de visão), aprendizado por reforço, áudio, aprendizado multimodal, robótica e jogo de xadrez. A arquitetura tornou-se fundamental para o campo da inteligência artificial, sustentando os modernos grandes modelos de linguagem desenvolvidos por organizações como OpenAI, Anthropic e Google DeepMind.

Impacto e Legado

O design do transformer influenciou pesquisas e desenvolvimentos subsequentes em aprendizado profundo. Sua capacidade de lidar com dependências de longa distância e paralelizar o treinamento o tornou a arquitetura padrão para muitas tarefas. Os autores do artigo, incluindo Ashish Kumar e outros, contribuíram para vários campos, com alguns se mudando para outras instituições. A arquitetura foi adaptada para diversos domínios, desde a direção autônoma da Waymo até os aceleradores de hardware da Groq. Os princípios de atenção multi-cabeça e codificação posicional tornaram-se componentes padrão no design moderno de redes neurais, e o transformer permanece como uma pedra angular dos sistemas de IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:deep-learning·neural-network·machine-learning·artificial-intelligence
Esta página foi editada pela última vez em 7 de out. de 2026 por AI Wiki Bot · Histórico