Traduit de l'anglais

L'attention est un mécanisme de réseau neuronal qui permet aux modèles de pondérer la pertinence de différents éléments d'entrée lors de la production de sorties. C'est le composant central des transformeurs, qui sous-tend les [[large-language-model|modèles de langage modernes]] et les systèmes d'[[generative-ai|IA générative]].

L'attention est une technique en apprentissage automatique et en apprentissage profond qui permet à un réseau de neurones de se concentrer dynamiquement sur les parties les plus pertinentes de son entrée lors de la génération de chaque sortie. Au lieu de traiter une séquence dans un ordre fixe, l'attention calcule une somme pondérée sur toutes les positions d'entrée, avec des poids déterminés par des scores de pertinence appris. Ce mécanisme a été introduit dans le contexte des modèles Sequence-to-Sequence (Seq2Seq) et est devenu le bloc de construction fondamental de l'architecture Transformer (architecture), qui alimente la plupart des modèles de langage de grande taille et des systèmes IA générative contemporains.

Dans une opération d'attention typique, chaque élément d'entrée est transformé en trois vecteurs : une requête, une clé et une valeur. La requête de la position actuelle est comparée aux clés de toutes les positions pour produire des scores d'attention, souvent via un produit scalaire. Ces scores sont normalisés (généralement avec une fonction softmax) pour former des poids, qui sont ensuite utilisés pour calculer une somme pondérée des vecteurs de valeur. Cela permet au modèle de récupérer des informations de n'importe où dans la séquence, indépendamment de la distance, ce qui répond à une limitation clé des architectures récurrentes antérieures qui peinaient avec les dépendances à longue portée.

Origines et Développement

Le concept d'attention est issu de la recherche sur la traduction automatique neuronale au milieu des années 2010. Un article fondateur de 2014 de Dzmitry Bahdanau et ses collègues a introduit un mécanisme d'attention qui permettait à un modèle encodeur-décodeur d'aligner les mots sources avec les mots cibles pendant la traduction. Cela a amélioré les performances sur les phrases longues par rapport aux vecteurs de contexte de longueur fixe. En 2015, Yoshua Bengio et d'autres ont exploré davantage les variantes d'attention, et en 2016, des chercheurs de Google Brain ont développé l'architecture Transformer (architecture), qui reposait exclusivement sur l'attention et éliminait entièrement la récurrence. Le transformer a été introduit dans l'article de 2017 « Attention Is All You Need » par Ashish Kumar, Jakob Uszkoreit, Lukasz Kaiser, Niki Parmar et d'autres, et il est rapidement devenu la norme pour la modélisation de séquences.

Attention Multi-Têtes et Variantes

Le transformer utilise attention multi-têtes, où plusieurs mécanismes d'attention fonctionnent en parallèle, chacun apprenant des relations différentes. Les sorties sont concaténées et projetées linéairement. Cela permet au modèle de capturer des schémas divers, tels que des dépendances syntaxiques et sémantiques simultanément. Une autre variante importante est l'attention croisée, utilisée dans les modèles encodeur-décodeur où les requêtes proviennent du décodeur et les clés/valeurs de l'encodeur, permettant au décodeur de se concentrer sur la séquence d'entrée. L'auto-attention, où les requêtes, clés et valeurs proviennent toutes de la même séquence, est utilisée à la fois dans l'encodeur et le décodeur du transformer. Un encodage positionnel est ajouté aux plongements d'entrée pour injecter des informations sur l'ordre des jetons, car l'attention elle-même est invariante par permutation.

Rôle dans les Modèles de Langage de Grande Taille

L'attention est le mécanisme central dans pratiquement tous les modèles de langage de grande taille modernes, y compris ceux développés par OpenAI, Anthropic et Google DeepMind. Ces modèles, tels que GPT et Claude, utilisent des couches de transformer empilées avec auto-attention pour traiter et générer du texte. La capacité de se concentrer sur tous les jetons d'une fenêtre de contexte permet une génération longue et cohérente, un apprentissage en contexte et un raisonnement complexe. Cependant, le coût computationnel quadratique de l'attention par rapport à la longueur de séquence a motivé la recherche de variantes efficaces, telles que l'attention sparse et l'attention linéaire, pour gérer des contextes plus longs. Au début des années 2020, la plupart des modèles de production utilisent une attention complète avec des fenêtres de contexte allant de quelques milliers à des centaines de milliers de jetons.

Applications au-delà du Langage

L'attention a été appliquée au-delà du traitement du langage naturel. En vision par ordinateur, les transformers de vision (ViT) traitent les patchs d'image comme des jetons et utilisent l'auto-attention pour la classification d'images et la détection d'objets. En reconnaissance vocale, les mécanismes d'attention alignent les trames audio avec les sorties textuelles. En apprentissage par renforcement, l'attention aide les agents à se concentrer sur les parties pertinentes des observations. Le mécanisme est également utilisé dans les systèmes de recommandation et la découverte de médicaments. Sa polyvalence en a fait un outil universel dans la recherche en intelligence artificielle, et il est un composant clé de nombreux systèmes de pointe à travers les domaines.

Considérations Computationnelles et Matériel

Les opérations d'attention impliquent de grandes multiplications matricielles, qui sont bien adaptées au traitement parallèle sur GPU et accélérateurs spécialisés. Des entreprises comme NVIDIA et AMD conçoivent du matériel qui optimise ces opérations. Les fournisseurs de cloud tels que Amazon Web Services, Google Cloud et Azure proposent des instances avec mémoire à haute bande passante pour gérer les calculs d'attention. L'empreinte mémoire de l'attention croît quadratiquement avec la longueur de séquence, ce qui a conduit à des techniques comme le gradient checkpointing et l'attention flash pour réduire l'utilisation de la mémoire. À mesure que les modèles évoluent, les implémentations efficaces de l'attention restent un domaine actif de recherche et d'ingénierie.

Directions Futures

La recherche continue d'améliorer les mécanismes d'attention. Les efforts incluent la réduction de la complexité computationnelle, l'incorporation de mémoire externe et la rendre l'attention plus interprétable. Certains travaux explorent des alternatives à l'attention complète, telles que les modèles à espace d'état, mais l'attention reste le paradigme dominant. En 2025, les modèles basés sur le transformer avec attention sont le fondement de la plupart des produits commerciaux d'IA, et le mécanisme devrait rester central pour le développement de l'IA dans un avenir prévisible.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·deep-learning·neural-networks·natural-language-processing
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique