Mécanisme d'attention

Traduit de l'anglais

Un mécanisme d'attention est un composant de réseau de neurones qui calcule une combinaison pondérée d'éléments d'entrée en fonction de leur pertinence par rapport à un contexte donné, constituant le calcul central au sein des modèles de transformeurs.

Un mécanisme d'attention est un composant de réseau de neurones qui calcule une combinaison pondérée des éléments de son entrée en fonction de leur pertinence par rapport à un contexte donné, permettant à un modèle de se concentrer dynamiquement sur les parties les plus importantes de cette entrée plutôt que de traiter chaque élément de manière égale. L'attention est l'idée computationnelle centrale derrière l'architecture Transformer (architecture) et, par extension, la plupart des modèles de langage de grande taille modernes.

Historique

L'attention a été introduite dans le contexte des modèles de traduction automatique Seq2seq vers 2014 et 2015, comme un moyen de permettre à un décodeur basé sur un réseau de neurones récurrent de revenir sur tous les états cachés de l'encodeur lors de la production de chaque mot de sortie, plutôt que de s'appuyer sur un unique vecteur récapitulatif de longueur fixe de la phrase d'entrée entière. Cela répondait à une faiblesse spécifique des modèles encodeur-décodeur antérieurs, qui tendaient à perdre des informations provenant de longues séquences d'entrée. L'article de 2017 Attention Is All You Need, dirigé par Ashish Vaswani et ses collègues, a montré qu'un modèle entièrement construit à partir de couches d'attention, sans aucune récurrence, pouvait surpasser les architectures récurrentes tout en étant bien plus parallélisable à l'entraînement, donnant naissance au transformer.

Auto-attention

L'innovation clé utilisée dans les transformers est l'auto-attention, dans laquelle chaque élément d'une séquence prête attention à chaque autre élément de la même séquence, plutôt qu'un décodeur prêtant attention à un encodeur séparé. Pour chaque position, le modèle calcule trois vecteurs, communément appelés requête, clé et valeur, dérivés de l'plongement de cette position. La similarité entre la requête d'une position et les clés de toutes les autres positions détermine le poids avec lequel la valeur de cette autre position contribue à la sortie à la position actuelle. Cela permet à un modèle traitant une phrase de relier directement des mots éloignés, comme un pronom et le nom auquel il se réfère, sans que l'information doive passer par de nombreuses étapes intermédiaires comme ce serait le cas dans un réseau récurrent.

Variantes

Les transformers utilisent généralement l'attention multi-têtes, exécutant plusieurs calculs d'attention en parallèle avec différentes projections apprises, permettant au modèle de capturer différents types de relations, telles que la structure syntaxique et la similarité thématique, simultanément. L'attention croisée, dans laquelle une séquence prête attention à une séquence distincte, est utilisée dans les transformers encodeur-décodeur et dans certains systèmes multimodaux, par exemple en permettant à un décodeur générant une légende de prêter attention aux régions encodées d'une image.

Importance pratique

Le coût computationnel de l'attention croît de manière quadratique avec la longueur de la séquence d'entrée, car chaque position doit être comparée à chaque autre position, ce qui a rendu le traitement de très longues entrées coûteux et a motivé à la fois des variantes d'attention axées sur l'efficacité et des architectures alternatives telles que les modèles à espace d'état. Malgré ce coût, la capacité de l'attention à relier directement des éléments distants d'une entrée, combinée à sa parallélisabilité par rapport à la récurrence, en a fait le mécanisme qui a débloqué l'échelle à laquelle les modèles de langage de grande taille sont entraînés, y compris la croissance de la fenêtre de contexte qui détermine la quantité de texte à laquelle un modèle peut prêter attention lors d'une seule interaction.

Catégories:deep-learning·large-language-models
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique