« Attention Is All You Need » est un article de recherche de 2017 sur l'apprentissage automatique, rédigé par huit scientifiques et ingénieurs travaillant chez Google. L'article a introduit une nouvelle architecture d'apprentissage profond connue sous le nom de transformeur, basée sur le mécanisme d'attention proposé en 2014 par Bahdanau et al. L'approche du transformeur est devenue l'architecture principale pour une grande variété de systèmes d'intelligence artificielle, y compris les modèles de langage de grande taille. À l'époque, la recherche se concentrait sur l'amélioration des techniques de séquence à séquence pour la traduction automatique, mais les auteurs prévoyaient le potentiel de cette technique pour d'autres tâches comme la réponse aux questions et ce qui est désormais connu sous le nom de IA générative multimodale.
Les premières expériences avec l'architecture du transformeur comprenaient la traduction de l'anglais vers l'allemand, la génération d'articles Wikipédia sur « Le Transformeur » et l'analyse syntaxique. Ces tests ont convaincu l'équipe que le transformeur est un modèle de langage généraliste, et non pas uniquement destiné à la traduction. En 2026, l'article a été cité plus de 250 000 fois, le plaçant parmi les dix articles les plus cités du XXIe siècle. Après la publication, chacun des huit auteurs a quitté Google pour rejoindre d'autres entreprises ou fonder des startups.
Contexte
Les auteurs sont Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser et Illia Polosukhin. Les huit ont contribué à parts égales ; l'ordre de liste a été randomisé. Le titre fait référence à la chanson des Beatles « All You Need Is Love ». Le nom « Transformer » a été choisi parce que Jakob Uszkoreit aimait la sonorité du mot. Un document de conception précoce était intitulé « Transformers: Iterative Self-Attention and Processing for Various Tasks » et comprenait une illustration de six personnages de la franchise Transformers. L'équipe a été nommée Team Transformer.
Méthodes introduites
L'article est surtout connu pour avoir introduit l'architecture du transformeur, qui sous-tend la plupart des modèles de langage modernes de grande taille. Une raison clé de sa préférence est la parallélisabilité de l'architecture par rapport à ses prédécesseurs, permettant un entraînement sur GPU et offrant des temps d'entraînement plus rapides et des modèles plus grands. L'article a introduit plusieurs mécanismes.
Attention produit scalaire normalisée et auto-attention
L'article a décrit l'attention produit scalaire normalisée comme : Attention(Query, Key, Value) = softmax(Query × Key^T / sqrt(d_k)) × Value, où Query, Key et Value sont des matrices et d_k est la dimension des clés (initialement fixée à 64). L'utilisation de l'auto-attention au lieu des réseaux de neurones récurrents (RNN) ou de la mémoire à long terme (LSTM) élimine la récurrence, garantissant la parallélisabilité. En traduction, les matrices Query et Key correspondent généralement aux plongements de la langue source, tandis que Value correspond à la langue cible.
Attention multi-têtes
Dans l'auto-attention, les requêtes, clés et valeurs sont générées dynamiquement pour chaque séquence d'entrée, permettant au modèle de se concentrer sur différentes parties. L'attention multi-têtes introduit plusieurs têtes d'attention parallèles, chacune apprenant différentes projections linéaires de Q, K et V. Cela permet au modèle de capturer simultanément différents aspects des relations entre les mots.
Encodage positionnel
Étant donné que le transformeur n'a pas de récurrence, l'article a introduit le encodage positionnel pour injecter des informations sur la position des jetons dans la séquence. Ces encodages sont ajoutés aux plongements d'entrée, permettant au modèle d'utiliser les informations d'ordre.
Impact et héritage
L'architecture du transformeur est devenue la fondation de la plupart des modèles de langage modernes de grande taille, y compris ceux développés par OpenAI, Anthropic et Google DeepMind. Sa parallélisabilité et son évolutivité ont stimulé les avancées dans la IA générative et d'autres domaines. L'influence de l'article se reflète dans son nombre de citations, ce qui en fait l'un des articles les plus cités du XXIe siècle.
Conséquences
Après la publication de l'article, les huit auteurs ont quitté Google. Certains ont fondé des startups, comme Aidan Gomez (Cohere) et Noam Shazeer (Character.AI, revenu plus tard chez Google). D'autres ont rejoint des entreprises comme NVIDIA ou Intel. Leur départ a contribué à la diffusion de la recherche basée sur le transformeur dans toute l'industrie.