"Attention Is All You Need" é um artigo de pesquisa de 2017 sobre aprendizado de máquina escrito por oito cientistas e engenheiros que trabalhavam no Google. O artigo introduziu uma nova arquitetura de aprendizado profundo conhecida como transformador, baseada no mecanismo de atenção proposto em 2014 por Bahdanau et al. A abordagem do transformador tornou-se a principal arquitetura para uma ampla variedade de sistemas de inteligência artificial, incluindo modelos de linguagem de grande porte. Na época, a pesquisa focava em melhorar técnicas de sequência a sequência para tradução automática, mas os autores previram o potencial da técnica para outras tarefas, como resposta a perguntas e o que hoje é conhecido como IA generativa multimodal.
Experimentos iniciais com a arquitetura do transformador incluíram tradução de inglês para alemão, geração de artigos da Wikipédia sobre "O Transformador" e análise sintática. Esses testes convenceram a equipe de que o transformador é um modelo de linguagem de propósito geral, não apenas para tradução. Em 2026, o artigo foi citado mais de 250.000 vezes, colocando-o entre os dez artigos mais citados do século XXI. Após a publicação, cada um dos oito autores deixou o Google para ingressar em outras empresas ou fundar startups.
Contexto
Os autores são Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Todos os oito foram contribuidores iguais; a ordem listada foi randomizada. O título faz referência à música dos Beatles "All You Need Is Love". O nome "Transformador" foi escolhido porque Jakob Uszkoreit gostou do som da palavra. Um documento de design inicial foi intitulado "Transformers: Iterative Self-Attention and Processing for Various Tasks" e incluía uma ilustração de seis personagens da franquia Transformers. A equipe foi nomeada Team Transformer.
Métodos introduzidos
O artigo é mais conhecido por introduzir a arquitetura do transformador, que sustenta a maioria dos LLMs modernos. Uma razão chave para sua preferência é a paralelizabilidade da arquitetura em relação a seus predecessores, permitindo treinamento em GPUs e possibilitando tempos de treinamento mais rápidos e modelos maiores. O artigo introduziu vários mecanismos.
Atenção de produto escalar escalonada e autoatenção
O artigo descreveu a atenção de produto escalar escalonada como: Attention(Query, Key, Value) = softmax(Query × Key^T / sqrt(d_k)) × Value, onde Query, Key e Value são matrizes e d_k é a dimensão das chaves (inicialmente definida como 64). Usar autoatenção em vez de redes neurais recorrentes (RNNs) ou memória de longo prazo (LSTM) elimina a recorrência, garantindo paralelizabilidade. Na tradução, as matrizes Query e Key correspondem tipicamente a embeddings do idioma de origem, enquanto Value corresponde ao idioma de destino.
Atenção multi-cabeça
Na autoatenção, consultas, chaves e valores são gerados dinamicamente para cada sequência de entrada, permitindo que o modelo foque em diferentes partes. A atenção multi-cabeça introduz múltiplas cabeças de atenção paralelas, cada uma aprendendo diferentes projeções lineares de Q, K e V. Isso permite que o modelo capture diferentes aspectos das relações entre palavras simultaneamente.
Codificação posicional
Como o transformador não tem recorrência, o artigo introduziu codificação posicional para injetar informações sobre a posição dos tokens na sequência. Essas codificações são adicionadas aos embeddings de entrada, permitindo que o modelo use informações de ordem.
Impacto e legado
A arquitetura do transformador tornou-se a base para a maioria dos modelos de linguagem de grande porte modernos, incluindo aqueles desenvolvidos por OpenAI, Anthropic e Google DeepMind. Sua paralelizabilidade e escalabilidade impulsionaram avanços em IA generativa e outros campos. A influência do artigo é refletida em seu número de citações, tornando-o um dos artigos mais citados do século XXI.
Consequências
Após a publicação do artigo, todos os oito autores deixaram o Google. Alguns fundaram startups, como Aidan Gomez (Cohere) e Noam Shazeer (Character.AI, retornando posteriormente ao Google). Outros ingressaram em empresas como NVIDIA ou Intel. Sua saída contribuiu para a disseminação da pesquisa baseada em transformadores em toda a indústria.