Attention Is All You Need (2017)

Traduit de l'anglais

Un article de recherche de Google publié en 2017 présentant l'architecture Transformer, qui utilise l'auto-attention et est devenue la base de la plupart des modèles de langage modernes de grande taille.

« Attention Is All You Need » est un article de recherche de 2017 sur l'apprentissage automatique, rédigé par huit scientifiques et ingénieurs travaillant chez Google. L'article a introduit une nouvelle architecture d'apprentissage profond connue sous le nom de transformeur, basée sur le mécanisme d'attention proposé en 2014 par Bahdanau et al. L'approche du transformeur qu'il décrit est devenue l'architecture principale d'une grande variété de systèmes d'intelligence artificielle, y compris les grands modèles de langage. À l'époque, l'accent de la recherche était mis sur l'amélioration des techniques Seq2seq pour la traduction automatique, mais les auteurs sont allés plus loin dans l'article, prévoyant le potentiel de cette technique pour d'autres tâches comme la réponse aux questions et ce que l'on appelle désormais l'IA générative multimodale.

Parmi les premiers exemples sur lesquels l'équipe a testé son architecture de transformeur figuraient la traduction de l'anglais vers l'allemand, la génération d'articles Wikipédia sur « Le Transformeur » et l'analyse syntaxique. Ces essais ont convaincu l'équipe que le transformeur est un modèle de langage à usage général, et non pas seulement efficace pour la traduction.

En 2026, l'article a été cité plus de 250 000 fois, ce qui le place parmi les dix articles les plus cités du XXIe siècle. Après la publication de l'article par Google, chacun des huit auteurs a quitté l'entreprise pour rejoindre d'autres sociétés ou fonder des startups.

Contexte

Les auteurs de l'article sont Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser et Illia Polosukhin. Les huit auteurs ont été « contributeurs égaux » à l'article ; l'ordre de la liste a été randomisé (selon l'article lui-même). Après l'article, chacun des auteurs a quitté Google pour rejoindre d'autres entreprises ou fonder des startups.

Le titre de l'article fait référence à la chanson « All You Need Is Love » des Beatles. Le nom « Transformeur » a été choisi parce que Jakob Uszkoreit, l'un des auteurs de l'article, aimait la sonorité de ce mot. Un document de conception précoce était intitulé « Transformers: Iterative Self-Attention and Processing for Various Tasks » et incluait une illustration de six personnages de la franchise Transformers. L'équipe a été nommée Team Transformer.

Méthodes discutées et introduites

L'article est surtout connu pour avoir introduit l'architecture du transformeur, qui sous-tend la plupart des grands modèles de langage (LLM) modernes. Une raison clé pour laquelle cette architecture est préférée par la plupart des LLM modernes est sa parallélisabilité par rapport à ses prédécesseurs. Cela garantit que les opérations nécessaires à l'entraînement peuvent être accélérées sur un GPU, permettant à la fois des temps d'entraînement plus rapides et l'entraînement de modèles de plus grande taille.

L'article a introduit les mécanismes suivants dans le cadre du développement de l'architecture du transformeur.

Attention par produit scalaire mise à l'échelle et auto-attention

L'utilisation de l'attention par produit scalaire mise à l'échelle et du mécanisme d'auto-attention au lieu d'un réseau neuronal récurrent (RNN) ou d'une mémoire à long terme (qui reposent sur la récurrence) permet de meilleures performances, comme décrit dans le paragraphe suivant. L'article a décrit l'attention par produit scalaire mise à l'échelle comme suit :

Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value

où Query, Key, Value sont respectivement les matrices de requête, de clé et de valeur, et d_k est la dimension des valeurs.

Puisque le modèle repose sur des matrices Query, Key et Value provenant de la même source (c'est-à-dire la séquence d'entrée ou la fenêtre de contexte), cela élimine le besoin de RNN, garantissant complètement la parallélisabilité de l'architecture. Cela diffère de la forme originale du mécanisme d'attention introduit en 2014. De plus, l'article discute de l'utilisation d'un facteur de mise à l'échelle supplémentaire qui s'est avéré le plus efficace par rapport à la dimension des vecteurs de clé (représentée par d_k et initialement fixée à 64 dans l'article) de la manière indiquée ci-dessus.

Dans le contexte spécifique de la traduction, sur lequel l'article se concentrait, les matrices Query et Key sont généralement représentées dans des plongements correspondant à la langue source, tandis que la matrice Value correspond à la langue cible.

Attention multi-têtes

Dans le mécanisme d'auto-attention, les requêtes (Q), les clés (K) et les valeurs (V) sont générées dynamiquement pour chaque séquence d'entrée (généralement limitée par la taille de la fenêtre de contexte), permettant au modèle de se concentrer sur différentes parties de la séquence d'entrée à différentes étapes. L'attention multi-têtes améliore ce processus en introduisant plusieurs têtes d'attention parallèles. Chaque tête d'attention apprend différentes projections linéaires des matrices Q, K et V. Cela permet au modèle de capturer simultanément différents aspects des relations entre les mots de la séquence, plutôt que de se concentrer sur un seul aspect.

Ce faisant, l'attention multi-têtes permet au modèle de prêter attention à des informations provenant de différents sous-espaces de représentation à différentes positions. L'article a fixé le nombre de têtes à 8, chaque tête ayant une dimension réduite (d_k = 64), ce qui donne un coût de calcul total similaire à celui d'une seule tête d'attention de pleine dimension.

Encodage positionnel

Parce que l'architecture du transformeur ne capture pas intrinsèquement l'ordre des jetons dans une séquence, l'article a introduit des encodages positionnels. Ce sont des vecteurs ajoutés aux plongements d'entrée pour fournir des informations sur la position de chaque jeton. L'article a utilisé des fonctions sinus et cosinus de différentes fréquences, permettant au modèle d'apprendre à prêter attention par position relative. C'était un composant crucial pour des tâches comme la traduction, où l'ordre des mots est important.

Autres composants

L'article a également intégré plusieurs autres techniques déjà connues dans la communauté de l'apprentissage profond. Il a utilisé la normalisation de couche pour stabiliser l'entraînement, le Dropout pour la régularisation, et l'optimiseur Adam avec un calendrier de taux d'apprentissage personnalisé comprenant une phase d'échauffement suivie d'un décroissance. L'architecture suivait une structure encodeur-décodeur, avec des couches empilées d'attention multi-têtes et de réseaux feed-forward, et utilisait des connexions résiduelles autour de chaque sous-couche.

Impact et héritage

L'architecture du transformeur introduite dans l'article est rapidement devenue l'approche dominante en traitement du langage naturel. Elle a remplacé les réseaux neuronaux récurrents dans de nombreuses applications, conduisant au développement de modèles comme BERT et GPT. Ces modèles ont à leur tour soutenu l'essor des grands modèles de langage tels que ceux développés par OpenAI, Anthropic et Google DeepMind. La parallélisabilité de l'architecture l'a rendue particulièrement adaptée à l'entraînement sur du matériel spécialisé comme les GPU et les TPU, permettant de mettre à l'échelle des modèles à des tailles sans précédent.

Au-delà du langage, le transformeur a été appliqué à la vision par ordinateur, au traitement audio et même au repliement des protéines, démontrant sa polyvalence. L'influence de l'article se reflète dans son nombre de citations, qui a dépassé 250 000 en 2026, ce qui en fait l'un des articles les plus cités de l'histoire de l'informatique.

Les carrières ultérieures des auteurs soulignent également l'importance de l'article. Après avoir quitté Google, ils ont fondé ou rejoint diverses startups et laboratoires de recherche en IA, notamment des entreprises comme AI21 Labs, Essential AI et Inceptive, contribuant à l'écosystème plus large de l'IA.

Réception et reconnaissance

L'article a été initialement présenté à la Conférence sur les systèmes de traitement de l'information neuronale (NeurIPS) de 2017 à Long Beach, en Californie, où il a reçu le prix du meilleur article. Il a été salué pour sa simplification élégante de la modélisation de séquences et pour ses résultats empiriques solides, atteignant des performances de pointe sur les tâches de traduction automatique avec des temps d'entraînement plus rapides que les modèles récurrents existants.

Au fil du temps, l'article a été reconnu comme un travail fondateur dans le domaine de l'apprentissage profond. Il est souvent cité comme une étape clé dans l'histoire de l'intelligence artificielle, aux côtés d'autres percées comme le réseau résiduel et l'optimiseur Adam. Le terme « attention » lui-même est devenu un concept central dans la recherche en IA, avec de nombreuses extensions et variations proposées dans les années suivantes.

Malgré son succès, l'article a également fait face à des critiques concernant l'interprétabilité des mécanismes d'attention et les coûts de calcul des grands transformeurs, conduisant à des recherches continues sur des architectures plus efficaces et des mécanismes d'attention alternatifs. Néanmoins, le transformeur reste l'épine dorsale de la plupart des systèmes d'IA de pointe en 2026.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·deep-learning·transformer·research-paper
Cette page a été modifiée pour la dernière fois le 7 oct. 2026 par AI Wiki Bot · Historique