"Attention Is All You Need" é um artigo de pesquisa de 2017 sobre aprendizado de máquina, escrito por oito cientistas e engenheiros que trabalhavam no Google. O artigo introduziu uma nova arquitetura de aprendizado profundo conhecida como transformer, baseada no mecanismo de atenção proposto em 2014 por Bahdanau et al. A abordagem transformer que ele descreve tornou-se a principal arquitetura de uma ampla variedade de sistemas de inteligência artificial, incluindo modelos de linguagem de grande porte. Na época, o foco da pesquisa era melhorar as técnicas Seq2seq para tradução automática, mas os autores foram além no artigo, prevendo o potencial da técnica para outras tarefas, como resposta a perguntas e o que hoje é conhecido como IA generativa multimodal.
Alguns exemplos iniciais nos quais a equipe testou sua arquitetura Transformer incluíam tradução de inglês para alemão, geração de artigos da Wikipédia sobre "The Transformer" e análise sintática. Esses testes convenceram a equipe de que o Transformer é um modelo de linguagem de propósito geral, e não apenas bom para tradução.
Em 2026, o artigo foi citado mais de 250.000 vezes, colocando-o entre os dez artigos mais citados do século XXI. Após a publicação do artigo pelo Google, cada um dos oito autores deixou a empresa para se juntar a outras empresas ou fundar startups.
Contexto
Os autores do artigo são Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Todos os oito autores foram "contribuidores iguais" para o artigo; a ordem listada foi randomizada (de acordo com o próprio artigo). Após o artigo, cada um dos autores deixou o Google para se juntar a outras empresas ou fundar startups.
O título do artigo é uma referência à música "All You Need Is Love" dos Beatles. O nome "Transformer" foi escolhido porque Jakob Uszkoreit, um dos autores do artigo, gostava do som dessa palavra. Um documento de design inicial foi intitulado "Transformers: Iterative Self-Attention and Processing for Various Tasks" e incluía uma ilustração de seis personagens da franquia Transformers. A equipe foi nomeada Team Transformer.
Métodos discutidos e introduzidos
O artigo é mais conhecido por introduzir a arquitetura Transformer, que sustenta a maioria dos modelos de linguagem de grande porte (LLMs) modernos. Uma razão fundamental pela qual a arquitetura é preferida pela maioria dos LLMs modernos é a paralelização da arquitetura em relação aos seus predecessores. Isso garante que as operações necessárias para o treinamento possam ser aceleradas em uma GPU, permitindo tempos de treinamento mais rápidos e modelos de tamanhos maiores a serem treinados.
O artigo introduziu os seguintes mecanismos como parte do desenvolvimento da arquitetura transformer.
Atenção de produto escalar escalonada e autoatenção
O uso da atenção de produto escalar escalonada e do mecanismo de autoatenção em vez de uma rede neural recorrente (RNN) ou memória de longo prazo (que dependem de recorrência) permite melhor desempenho, conforme descrito no parágrafo seguinte. O artigo descreveu a atenção de produto escalar escalonada da seguinte forma:
Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value
onde Query, Key e Value são, respectivamente, as matrizes de consulta, chave e valor, e d_k é a dimensão dos valores.
Como o modelo depende de matrizes Query, Key e Value que vêm da mesma fonte (ou seja, a sequência de entrada ou janela de contexto), isso elimina a necessidade de RNNs, garantindo completamente a paralelização da arquitetura. Isso difere da forma original do mecanismo de Atenção introduzido em 2014. Além disso, o artigo discute o uso de um fator de escalonamento adicional que se mostrou mais eficaz em relação à dimensão dos vetores de chave (representados como d_k e inicialmente definidos como 64 no artigo) da maneira mostrada acima.
No contexto específico da tradução, no qual o artigo se concentrou, as matrizes Query e Key são geralmente representadas em embeddings correspondentes ao idioma de origem, enquanto a matriz Value corresponde ao idioma de destino.
Atenção multi-cabeça
No mecanismo de autoatenção, consultas (Q), chaves (K) e valores (V) são gerados dinamicamente para cada sequência de entrada (tipicamente limitados pelo tamanho da janela de contexto), permitindo que o modelo se concentre em diferentes partes da sequência de entrada em diferentes etapas. A atenção multi-cabeça aprimora esse processo introduzindo múltiplas cabeças de atenção paralelas. Cada cabeça de atenção aprende diferentes projeções lineares das matrizes Q, K e V. Isso permite que o modelo capture diferentes aspectos das relações entre palavras na sequência simultaneamente, em vez de se concentrar em um único aspecto.
Ao fazer isso, a atenção multi-cabeça permite que o modelo atenda a informações de diferentes subespaços de representação em diferentes posições. O artigo definiu o número de cabeças como 8, com cada cabeça tendo uma dimensão reduzida (d_k = 64), resultando em um custo computacional total semelhante ao de uma única cabeça de atenção de dimensão completa.
Codificação posicional
Como a arquitetura Transformer não captura inerentemente a ordem dos tokens em uma sequência, o artigo introduziu codificações posicionais. Esses são vetores adicionados aos embeddings de entrada para fornecer informações sobre a posição de cada token. O artigo usou funções seno e cosseno de diferentes frequências, permitindo que o modelo aprendesse a atender por posição relativa. Este foi um componente crucial para tarefas como tradução, onde a ordem das palavras importa.
Outros componentes
O artigo também incorporou várias outras técnicas que já eram conhecidas na comunidade de aprendizado profundo. Ele usou normalização de camada para estabilizar o treinamento, Dropout para regularização e o otimizador Adam com um cronograma de taxa de aprendizado personalizado que incluía uma fase de aquecimento seguida de decaimento. A arquitetura seguiu uma estrutura codificador-decodificador, com camadas empilhadas de atenção multi-cabeça e redes feed-forward, e usou conexões residuais em torno de cada subcamada.
Impacto e legado
A arquitetura Transformer introduzida no artigo rapidamente se tornou a abordagem dominante no processamento de linguagem natural. Ela substituiu redes neurais recorrentes em muitas aplicações, levando ao desenvolvimento de modelos como BERT e GPT. Esses modelos, por sua vez, sustentaram o surgimento de modelos de linguagem de grande porte, como aqueles desenvolvidos por OpenAI, Anthropic e Google DeepMind. A paralelização da arquitetura a tornou particularmente adequada para treinamento em hardware especializado, como GPUs e TPUs, permitindo o escalonamento de modelos a tamanhos sem precedentes.
Além da linguagem, o Transformer foi aplicado à visão computacional, processamento de áudio e até mesmo ao dobramento de proteínas, demonstrando sua versatilidade. A influência do artigo é refletida em sua contagem de citações, que excedeu 250.000 em 2026, tornando-o um dos artigos mais citados na história da ciência da computação.
As carreiras subsequentes dos autores também destacam a importância do artigo. Após deixarem o Google, eles fundaram ou se juntaram a várias startups e laboratórios de pesquisa em IA, incluindo empresas como AI21 Labs, Essential AI e Inceptive, contribuindo para o ecossistema mais amplo de IA.
Recepção e reconhecimento
O artigo foi inicialmente apresentado na Conferência de 2017 sobre Sistemas de Processamento de Informação Neural (NeurIPS) em Long Beach, Califórnia, onde recebeu o Prêmio de Melhor Artigo. Foi elogiado por sua simplificação elegante da modelagem de sequências e por seus fortes resultados empíricos, alcançando desempenho de ponta em tarefas de tradução automática com tempos de treinamento mais rápidos do que os modelos recorrentes existentes.
Com o tempo, o artigo foi reconhecido como um trabalho fundamental no campo do aprendizado profundo. É frequentemente citado como um marco importante na história da inteligência artificial, ao lado de outros avanços como a rede residual e o otimizador Adam. O termo "atenção" em si tornou-se um conceito central na pesquisa em IA, com inúmeras extensões e variações propostas nos anos seguintes.
Apesar de seu sucesso, o artigo também enfrentou escrutínio em relação à interpretabilidade dos mecanismos de atenção e aos custos computacionais de grandes transformers, levando a pesquisas contínuas sobre arquiteturas mais eficientes e mecanismos de atenção alternativos. No entanto, o Transformer permanece como a espinha dorsal da maioria dos sistemas de IA de ponta em 2026.