Alimentation directe

Traduit de l'anglais

Le feed forward est un motif d'architecture de réseau de neurones où les données circulent dans une seule direction, de l'entrée vers la sortie, sans cycles, formant la base de la plupart des systèmes modernes d'apprentissage automatique, y compris les [[transformers]] et les [[large language models|grands modèles de langage]].

Feed forward est un motif architectural fondamental dans les réseaux de neurones où l'information se déplace strictement dans une seule direction : de la couche d'entrée, à travers les couches cachées, jusqu'à la couche de sortie, sans boucles ni connexions de rétroaction. Cette conception contraste avec les architectures récurrentes qui permettent à l'information de revenir en arrière, et elle sous-tend la grande majorité des systèmes contemporains de apprentissage automatique, y compris les modèles de apprentissage profond et les grands modèles de langage.

Le terme provient de la théorie du contrôle et des premières recherches en intelligence artificielle, où un système feed-forward calcule sa sortie directement à partir de son entrée sans dépendre de sorties précédentes. Dans le contexte des réseaux de neurones, cela signifie que les activations de chaque couche sont calculées uniquement à partir des activations de la couche précédente, créant une structure simple et composable qui peut être entraînée efficacement à l'aide de la rétropropagation.

Développement historique

Le concept des réseaux feed-forward remonte au perceptron, introduit par Frank Rosenblatt en 1958, qui était un modèle feed-forward à une seule couche. En 1969, le livre "Perceptrons" de Marvin Minsky et Seymour Papert a mis en évidence les limites des réseaux feed-forward à une seule couche, ralentissant la recherche. Le domaine a connu un renouveau dans les années 1980 avec la popularisation de la rétropropagation, qui a permis d'entraîner des réseaux feed-forward multicouches, souvent appelés perceptrons multicouches. Parmi les premiers contributeurs clés figuraient Bernard Widrow et des affiliés de Berkeley AI Research qui ont fait progresser le filtrage adaptatif et les algorithmes d'apprentissage.

Dans les années 2010, les architectures feed-forward sont devenues l'épine dorsale de l'IA moderne. L'architecture Transformer, introduite dans l'article de 2017 "Attention Is All You Need" par des chercheurs dont Jakob Uszkoreit, Lukasz Kaiser et Niki Parmar, repose fortement sur des couches feed-forward entrelacées avec des mécanismes d'attention. Cette conception alimente des systèmes développés par OpenAI, Anthropic et Google DeepMind.

Composants principaux

Un réseau feed-forward typique se compose d'une couche d'entrée, d'une ou plusieurs couches cachées et d'une couche de sortie. Chaque couche applique une transformation linéaire suivie d'une fonction d'activation non linéaire. Les fonctions d'activation courantes incluent ReLU (unité linéaire rectifiée), sigmoïde et tanh. Les poids et les biais sont appris grâce à des algorithmes d'optimisation tels que Adam ou variantes de descente de gradient stochastique.

Dans les architectures modernes, les couches feed-forward sont souvent expansées et contractées. Par exemple, dans un Transformer, chaque bloc contient un réseau feed-forward qui projette d'abord la représentation vers une dimension supérieure (souvent 4 fois la largeur du modèle), puis la projette en retour, avec une non-linéarité entre les deux. Cette conception, parfois appelée réseau feed-forward positionnel, traite chaque jeton indépendamment.

Rôle dans les architectures modernes

Les couches feed-forward sont essentielles dans les modèles encodeur-décodeur et les systèmes séquence à séquence. Dans le Transformer, les piles d'encodeur et de décodeur contiennent toutes deux des sous-couches feed-forward. Ces couches sont responsables de la transformation des représentations produites par les mécanismes d'attention multi-têtes, permettant au modèle d'apprendre des interactions complexes entre caractéristiques.

Les réseaux résiduels (ResNets), introduits en 2015, intègrent des connexions de saut qui permettent aux gradients de circuler plus facilement à travers des piles feed-forward profondes, permettant des réseaux avec des centaines de couches. Cette innovation a été cruciale pour faire évoluer les modèles vers la taille des systèmes modernes de IA générative. Des techniques comme la normalisation par lots et la normalisation de couche stabilisent davantage l'entraînement des réseaux feed-forward profonds.

Entraînement et optimisation

L'entraînement des réseaux feed-forward repose sur la rétropropagation, qui calcule les gradients de la fonction de perte par rapport à tous les poids. Les pratiques clés incluent les stratégies de initialisation des poids, les programmes de taux d'apprentissage et le écrêtage des gradients pour éviter les gradients explosifs. Les méthodes de régularisation telles que le dropout et l'augmentation des données aident à prévenir le surapprentissage.

Les fonctions de perte varient selon la tâche : la perte d'entropie croisée pour la classification, l'erreur quadratique moyenne pour la régression, et des pertes spécialisées pour les modèles génératifs. L'inférence utilise souvent des stratégies de décodage comme la recherche en faisceau ou des méthodes d'échantillonnage incluant l'échantillonnage top-k et l'échantillonnage top-p, avec la mise à l'échelle de température pour contrôler le caractère aléatoire.

Applications et variations

Les réseaux feed-forward sont utilisés dans divers domaines. En vision par ordinateur, les réseaux de neurones convolutifs (CNN) sont de nature feed-forward, avec des architectures comme U-Net (U-Net) pour la segmentation d'images. En traitement du langage naturel, les couches feed-forward font partie intégrante des Transformers utilisés dans les grands modèles de langage comme GPT et Claude. Les accélérateurs matériels d'entreprises telles que NVIDIA (bien que non inclus dans la liste fournie, notons que AMD, Intel et Qualcomm produisent également des puces pertinentes) sont optimisés pour les multiplications matricielles centrales au calcul feed-forward.

Les variations incluent les mécanismes d'attention croisée qui connectent les chemins feed-forward de l'encodeur et du décodeur, et les encodages positionnels qui fournissent des informations d'ordre. Des méthodes d'entraînement avancées comme RLAIF (apprentissage par renforcement à partir de retours d'IA) et l'apprentissage par curriculum affinent davantage le comportement du modèle. Les réseaux feed-forward apparaissent également dans des conceptions matérielles spécialisées, comme celles de Groq et SambaNova, qui optimisent l'inférence à faible latence.

Limites et orientations futures

Malgré leur succès, les réseaux feed-forward présentent des limites. Ils manquent de mémoire inhérente des entrées passées, ce qui les rend inadaptés aux données séquentielles sans mécanismes externes. Ils peuvent également être intensifs en calcul, nécessitant de grandes quantités d'énergie et du matériel spécialisé. La recherche se poursuit sur des architectures plus efficaces, telles que les couches de mélange d'experts qui n'activent qu'un sous-ensemble de paramètres feed-forward par entrée, et sur la compréhension de leurs propriétés théoriques.

Au milieu des années 2020, le feed-forward reste le paradigme dominant en IA, avec des innovations continues provenant d'institutions académiques comme Stanford AI Lab et MIT CSAIL, ainsi que de laboratoires industriels. La simplicité et l'évolutivité des conceptions feed-forward garantissent leur pertinence continue dans la recherche et les systèmes déployés.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:neural-networks·machine-learning·deep-learning·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique