"Attention Is All You Need" é um artigo de pesquisa de 2017 sobre aprendizado de máquina, escrito por oito cientistas e engenheiros que trabalhavam no Google. O artigo introduziu uma nova arquitetura de aprendizado profundo conhecida como transformer, baseada no mecanismo de atenção proposto em 2014 por Bahdanau et al. A abordagem transformer descrita no artigo tornou-se a principal arquitetura de uma ampla variedade de sistemas de inteligência artificial, incluindo grandes modelos de linguagem. Na época, o foco da pesquisa era melhorar as técnicas Seq2seq para tradução automática, mas os autores foram além no artigo, prevendo o potencial da técnica para outras tarefas, como resposta a perguntas e o que hoje é conhecido como IA generativa multimodal.
Alguns exemplos iniciais nos quais a equipe testou sua arquitetura Transformer incluíam tradução de inglês para alemão, geração de artigos da Wikipédia sobre "The Transformer" e análise sintática. Esses testes convenceram a equipe de que o Transformer é um modelo de linguagem de propósito geral, e não apenas bom para tradução. Em 2026, o artigo já havia sido citado mais de 250.000 vezes, colocando-o entre os dez artigos mais citados do século XXI. Após a publicação do artigo pelo Google, cada um dos oito autores deixou a empresa para se juntar a outras empresas ou fundar startups.
Contexto
Os autores do artigo são Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Todos os oito autores foram "contribuidores iguais" para o artigo; a ordem listada foi randomizada (de acordo com o próprio artigo). Após o artigo, cada um dos autores deixou o Google para se juntar a outras empresas ou fundar startups.
O título do artigo é uma referência à música "All You Need Is Love" dos Beatles. O nome "Transformer" foi escolhido porque Jakob Uszkoreit, um dos autores do artigo, gostava do som dessa palavra. Um documento de design inicial foi intitulado "Transformers: Iterative Self-Attention and Processing for Various Tasks" e incluía uma ilustração de seis personagens da franquia Transformers. A equipe foi nomeada Team Transformer.
Métodos discutidos e introduzidos
O artigo é mais conhecido por introduzir a arquitetura Transformer, que sustenta a maioria dos grandes modelos de linguagem (LLMs) modernos. Uma razão fundamental pela qual a arquitetura é preferida pela maioria dos LLMs modernos é a paralelização da arquitetura em relação aos seus predecessores. Isso garante que as operações necessárias para o treinamento possam ser aceleradas em uma GPU, permitindo tempos de treinamento mais rápidos e modelos de tamanhos maiores.
O artigo introduziu os seguintes mecanismos como parte do desenvolvimento da arquitetura transformer.
Atenção de produto escalar escalonada e autoatenção
O uso do mecanismo de atenção de produto escalar escalonada e autoatenção em vez de uma rede neural recorrente (RNN) ou memória de longo prazo (que dependem de recorrência) permite melhor desempenho, conforme descrito no parágrafo seguinte. O artigo descreveu a atenção de produto escalar escalonada da seguinte forma:
Attention(Query, Key, Value) := softmax(Query × Key^T / sqrt(d_k)) × Value
onde Query, Key, Value são respectivamente as matrizes de consulta, chave e valor, e d_k é a dimensão dos valores. Como o modelo depende de matrizes Query, Key e Value que vêm da mesma fonte (ou seja, a sequência de entrada ou janela de contexto), isso elimina a necessidade de RNNs, garantindo completamente a paralelização da arquitetura. Isso difere da forma original do mecanismo de Atenção introduzido em 2014. Além disso, o artigo discute o uso de um fator de escalonamento adicional que se mostrou mais eficaz em relação à dimensão dos vetores de chave (representados como d_k e inicialmente definidos como 64 no artigo) da maneira mostrada acima. No contexto específico da tradução, que era o foco do artigo, as matrizes Query e Key são geralmente representadas em embeddings correspondentes ao idioma de origem, enquanto a matriz Value corresponde ao idioma de destino.
Atenção multi-cabeça
No mecanismo de autoatenção, consultas (Q), chaves (K) e valores (V) são gerados dinamicamente para cada sequência de entrada (tipicamente limitados pelo tamanho da janela de contexto), permitindo que o modelo se concentre em diferentes partes da sequência de entrada em diferentes etapas. A atenção multi-cabeça aprimora esse processo ao introduzir múltiplas cabeças de atenção paralelas. Cada cabeça de atenção aprende diferentes projeções lineares das matrizes Q, K e V. Isso permite que o modelo capture diferentes aspectos das relações entre palavras na sequência simultaneamente, em vez de se concentrar em um único aspecto. Ao fazer isso, o modelo pode atender a informações de diferentes subespaços de representação em diferentes posições, o que melhora sua capacidade de lidar com padrões linguísticos complexos.
Codificação posicional
O artigo introduziu codificação posicional para injetar informações sobre a posição dos tokens na sequência, já que a arquitetura não processa tokens inerentemente em ordem. Os autores propuseram o uso de funções seno e cosseno de diferentes frequências para codificar posições, permitindo que o modelo aprenda posições relativas. Esse mecanismo se tornou padrão em modelos baseados em transformer, embora variantes posteriores tenham explorado embeddings aprendidos ou outras abordagens.
Outras inovações
O artigo também discutiu o uso de normalização de camada e conexões residuais para estabilizar o treinamento, bem como Dropout para regularização. Esses componentes, combinados com os mecanismos de atenção, formaram a base do bloco transformer. Os autores treinaram seus modelos em tarefas de tradução automática, alcançando resultados de ponta com tempos de treinamento mais rápidos em comparação com modelos recorrentes.
Impacto e legado
Após sua publicação, a arquitetura Transformer rapidamente se tornou a abordagem dominante no processamento de linguagem natural. Ela sustenta sistemas importantes desenvolvidos por organizações como OpenAI, Google DeepMind e Anthropic, incluindo grandes modelos de linguagem como GPT e BERT. A arquitetura também foi aplicada além do texto, influenciando campos como visão computacional e processamento de áudio. A influência do artigo se reflete em seu número de citações, que excede 250.000 em 2026, tornando-o uma das obras mais citadas na ciência da computação.
A saída de todos os oito autores do Google logo após a publicação levou à fundação de várias startups de IA, incluindo Cohere e Inceptive, e contribuiu para a comercialização mais ampla de tecnologias baseadas em transformer. O título do artigo, referenciando a música dos Beatles, e as convenções de nomenclatura lúdicas da equipe tornaram-se parte do folclore da IA.