Artigo Transformer (2017)

Traduzido do inglês

O artigo de 2017 'Attention Is All You Need', de oito pesquisadores do Google, introduziu a arquitetura transformer, que se baseia em autoatenção e se tornou a base para a maioria dos modelos de linguagem de grande porte modernos.

"Attention Is All You Need" é um artigo de pesquisa de 2017 sobre aprendizado de máquina escrito por oito cientistas e engenheiros que trabalhavam no Google. O artigo introduziu uma nova arquitetura de aprendizado profundo conhecida como transformador, baseada no mecanismo de atenção proposto em 2014 por Bahdanau et al. A abordagem do transformador tornou-se a principal arquitetura para uma ampla variedade de sistemas de inteligência artificial, incluindo modelos de linguagem de grande porte. Na época, a pesquisa focava em melhorar técnicas de sequência a sequência para tradução automática, mas os autores previram o potencial da técnica para outras tarefas, como resposta a perguntas e o que hoje é conhecido como IA generativa multimodal.

Experimentos iniciais com a arquitetura do transformador incluíram tradução de inglês para alemão, geração de artigos da Wikipédia sobre "O Transformador" e análise sintática. Esses testes convenceram a equipe de que o transformador é um modelo de linguagem de propósito geral, não apenas para tradução. Em 2026, o artigo foi citado mais de 250.000 vezes, colocando-o entre os dez artigos mais citados do século XXI. Após a publicação, cada um dos oito autores deixou o Google para ingressar em outras empresas ou fundar startups.

Contexto

Os autores são Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Todos os oito foram contribuidores iguais; a ordem listada foi randomizada. O título faz referência à música dos Beatles "All You Need Is Love". O nome "Transformador" foi escolhido porque Jakob Uszkoreit gostou do som da palavra. Um documento de design inicial foi intitulado "Transformers: Iterative Self-Attention and Processing for Various Tasks" e incluía uma ilustração de seis personagens da franquia Transformers. A equipe foi nomeada Team Transformer.

Métodos introduzidos

O artigo é mais conhecido por introduzir a arquitetura do transformador, que sustenta a maioria dos LLMs modernos. Uma razão chave para sua preferência é a paralelizabilidade da arquitetura em relação a seus predecessores, permitindo treinamento em GPUs e possibilitando tempos de treinamento mais rápidos e modelos maiores. O artigo introduziu vários mecanismos.

Atenção de produto escalar escalonada e autoatenção

O artigo descreveu a atenção de produto escalar escalonada como: Attention(Query, Key, Value) = softmax(Query × Key^T / sqrt(d_k)) × Value, onde Query, Key e Value são matrizes e d_k é a dimensão das chaves (inicialmente definida como 64). Usar autoatenção em vez de redes neurais recorrentes (RNNs) ou memória de longo prazo (LSTM) elimina a recorrência, garantindo paralelizabilidade. Na tradução, as matrizes Query e Key correspondem tipicamente a embeddings do idioma de origem, enquanto Value corresponde ao idioma de destino.

Atenção multi-cabeça

Na autoatenção, consultas, chaves e valores são gerados dinamicamente para cada sequência de entrada, permitindo que o modelo foque em diferentes partes. A atenção multi-cabeça introduz múltiplas cabeças de atenção paralelas, cada uma aprendendo diferentes projeções lineares de Q, K e V. Isso permite que o modelo capture diferentes aspectos das relações entre palavras simultaneamente.

Codificação posicional

Como o transformador não tem recorrência, o artigo introduziu codificação posicional para injetar informações sobre a posição dos tokens na sequência. Essas codificações são adicionadas aos embeddings de entrada, permitindo que o modelo use informações de ordem.

Impacto e legado

A arquitetura do transformador tornou-se a base para a maioria dos modelos de linguagem de grande porte modernos, incluindo aqueles desenvolvidos por OpenAI, Anthropic e Google DeepMind. Sua paralelizabilidade e escalabilidade impulsionaram avanços em IA generativa e outros campos. A influência do artigo é refletida em seu número de citações, tornando-o um dos artigos mais citados do século XXI.

Consequências

Após a publicação do artigo, todos os oito autores deixaram o Google. Alguns fundaram startups, como Aidan Gomez (Cohere) e Noam Shazeer (Character.AI, retornando posteriormente ao Google). Outros ingressaram em empresas como NVIDIA ou Intel. Sua saída contribuiu para a disseminação da pesquisa baseada em transformadores em toda a indústria.

Ver também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·deep-learning·transformer·research-paper
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico