Recherche d’architecture neuronale

Traduit de l'anglais

La recherche d'architecture neuronale (NAS) est une technique permettant d'automatiser la conception de réseaux neuronaux artificiels, en utilisant des méthodes telles que l'apprentissage par renforcement, l'évolution et l'optimisation bayésienne pour trouver des architectures qui correspondent ou surpassent les modèles conçus manuellement.

La recherche d'architecture neuronale (NAS) est une technique permettant d'automatiser la conception de réseaux de neurones artificiels (ANN), un modèle largement utilisé dans le domaine de l'apprentissage automatique. La NAS a été utilisée pour concevoir des réseaux qui sont comparables ou supérieurs aux architectures conçues manuellement. Les méthodes de NAS peuvent être catégorisées selon l'espace de recherche, la stratégie de recherche et la stratégie d'estimation de performance utilisées. L'espace de recherche définit le(s) type(s) d'ANN qui peuvent être conçus et optimisés ; la stratégie de recherche définit l'approche utilisée pour explorer l'espace de recherche ; et la stratégie d'estimation de performance évalue la performance d'un ANN possible à partir de sa conception sans le construire ni l'entraîner. La NAS est étroitement liée à l'optimisation des hyperparamètres et au méta-apprentissage, et est un sous-domaine de l'apprentissage automatique automatisé (AutoML).

Apprentissage par renforcement

L'apprentissage par renforcement (RL) peut sous-tendre une stratégie de recherche NAS. Barret Zoph et Quoc Viet Le ont appliqué la NAS avec RL ciblant le jeu de données CIFAR-10 et ont obtenu une architecture de réseau qui rivalise avec la meilleure architecture conçue manuellement en termes de précision, avec un taux d'erreur de 3,65, soit 0,09 pour cent de mieux et 1,05 fois plus rapide qu'un modèle conçu manuellement apparenté. Sur le jeu de données Penn Treebank, ce modèle a composé une cellule récurrente qui surpasse LSTM, atteignant une perplexité sur l'ensemble de test de 62,4, soit 3,6 de perplexité de mieux que le système leader précédent. Sur la tâche de modélisation du langage par caractères PTB, il a atteint des bits par caractère de 1,214.

Apprendre une architecture de modèle directement sur un grand jeu de données peut être un processus long. NASNet a abordé ce problème en transférant un bloc de construction conçu pour un petit jeu de données à un plus grand jeu de données. La conception était contrainte à utiliser deux types de cellules convolutionnelles pour renvoyer des cartes de caractéristiques qui servent deux fonctions principales lors de la convolution d'une carte de caractéristiques d'entrée : des cellules normales qui renvoient des cartes de même étendue (hauteur et largeur) et des cellules de réduction dans lesquelles la hauteur et la largeur de la carte de caractéristiques renvoyée sont réduites d'un facteur deux. Pour la cellule de réduction, l'opération initiale appliquée aux entrées de la cellule utilise un pas de deux pour réduire la hauteur et la largeur. L'aspect appris de la conception incluait des éléments tels que quelle(s) couche(s) inférieure(s) chaque couche supérieure prenait en entrée, les transformations appliquées à cette couche, et comment fusionner plusieurs sorties à chaque couche. Dans l'exemple étudié, la meilleure couche convolutionnelle (ou « cellule ») a été conçue pour le jeu de données CIFAR-10 puis appliquée au jeu de données ImageNet en empilant des copies de cette cellule, chacune avec ses propres paramètres. L'approche a donné une précision de 82,7 % top-1 et 96,2 % top-5. Cela a dépassé les meilleures architectures inventées par l'homme au prix de 9 milliards de FLOPS en moins, soit une réduction de 28 %. Le système a continué à surpasser l'alternative conçue manuellement à différents niveaux de calcul. Les caractéristiques d'image apprises à partir de la classification d'images peuvent être transférées à d'autres problèmes de vision par ordinateur. Pour la détection d'objets, les cellules apprises intégrées au cadre Faster-RCNN ont amélioré les performances de 4,0 % sur le jeu de données COCO.

Dans la soi-disant recherche d'architecture neuronale efficace (ENAS), un contrôleur découvre des architectures en apprenant à rechercher un sous-graphe optimal dans un grand graphe. Le contrôleur est entraîné avec un gradient de politique pour sélectionner un sous-graphe qui maximise la récompense attendue de l'ensemble de validation. Le modèle correspondant au sous-graphe est entraîné pour minimiser une perte d'entropie croisée canonique. Plusieurs modèles enfants partagent des paramètres, donc ENAS nécessite moins d'heures GPU que d'autres approches et 1000 fois moins que la NAS « standard ». Sur CIFAR-10, la conception ENAS a atteint une erreur de test de 2,89 %, comparable à NASNet. Sur Penn Treebank, la conception ENAS a atteint une perplexité de test de 55,8.

Évolution

Une approche alternative de la NAS est basée sur des algorithmes évolutionnaires, qui a été employée par plusieurs groupes. Un algorithme évolutionnaire pour la recherche d'architecture neuronale effectue généralement la procédure suivante. D'abord, un pool composé de différentes architectures candidates avec leurs scores de validation (aptitude) est initialisé. À chaque étape, les architectures du pool candidat sont mutées (par exemple, convolution 3x3 au lieu d'une convolution 5x5). Ensuite, les nouvelles architectures sont entraînées à partir de zéro pendant quelques époques et leurs scores de validation sont obtenus. Cela est suivi du remplacement des architectures les moins bien notées du pool candidat par les nouvelles architectures meilleures. Cette procédure est répétée plusieurs fois, et ainsi le pool candidat est affiné au fil du temps. Les mutations dans le contexte de l'évolution des ANN sont des opérations telles que l'ajout ou la suppression d'une couche, y compris le changement du type d'une couche (par exemple, de convolution à pooling), le changement des hyperparamètres d'une couche, ou le changement des hyperparamètres d'entraînement. Sur CIFAR-10 et ImageNet, l'évolution et le RL ont performé de manière comparable, tandis que les deux ont légèrement surpassé la recherche aléatoire.

Optimisation bayésienne

L'optimisation bayésienne (BO), qui s'est avérée être une méthode efficace pour l'optimisation des hyperparamètres, peut également être appliquée à la NAS. Dans ce contexte, la fonction objectif mappe une architecture à son erreur de validation après avoir été entraînée pendant un certain nombre d'époques. À chaque itération, BO utilise un surrogate pour modéliser cette fonction objectif en fonction des architectures précédemment obtenues et de leurs erreurs de validation. On choisit ensuite la prochaine architecture à évaluer en maximisant une fonction d'acquisition, telle que l'amélioration attendue, qui fournit un équilibre entre exploration et exploitation. La maximisation de la fonction d'acquisition et l'évaluation de la fonction objectif sont souvent coûteuses en calcul pour la NAS, et rendent l'application de BO difficile dans ce contexte. Récemment, BANANAS a obtenu des résultats prometteurs dans cette direction en introduisant une instanciation performante de BO couplée à un prédicteur neuronal.

Montée de colline

Un autre groupe a utilisé une procédure de montée de colline qui applique des morphismes de réseau, suivis de courtes exécutions d'optimisation par recuit cosinusoïdal. L'approche a donné des résultats compétitifs, nécessitant des ressources du même ordre de grandeur que l'entraînement d'un seul réseau. Par exemple, sur CIFAR-10, la méthode a conçu et entraîné un réseau avec un taux d'erreur inférieur à 5 % en 12 heures sur un seul GPU.

Recherche multi-objectifs

Bien que la plupart des approches se concentrent uniquement sur la recherche d'une architecture avec une performance prédictive maximale, pour la plupart des applications pratiques, d'autres objectifs sont pertinents, tels que la consommation de mémoire, la taille du modèle ou le temps d'inférence (c'est-à-dire le temps nécessaire pour obtenir une prédiction). Pour cette raison, les chercheurs ont créé une recherche multi-objectifs. LEMONADE est un algorithme évolutionnaire qui a adopté le lamarckisme pour optimiser efficacement plusieurs objectifs. À chaque génération, des réseaux enfants sont générés pour améliorer la frontière de Pareto par rapport à la population actuelle d'ANN. Neural Architect est prétendu être une NAS basée sur RL multi-objectifs consciente des ressources avec intégration de réseau et prédiction de performance. L'intégration de réseau encode un réseau existant en un vecteur d'intégration entraînable, qui peut être utilisé pour prédire la performance et guider la recherche vers des architectures qui équilibrent précision et contraintes de ressources.

Défis et orientations futures

La NAS reste intensive en calcul malgré les avancées comme ENAS et le partage de poids. La conception de l'espace de recherche influence fortement les résultats, et l'évaluation des architectures nécessite souvent un calcul significatif. Des travaux récents ont exploré la NAS différentiable, où la recherche est relaxée en un problème d'optimisation continue, et des méthodes basées sur des prédicteurs qui apprennent à estimer la performance sans entraînement complet. À partir du milieu des années 2020, la NAS continue d'évoluer, avec des applications dans les modèles Deep learning, y compris les architectures basées sur Transformer (architecture), et l'intégration avec des pipelines d'apprentissage automatique automatisé. Des chercheurs d'institutions comme Google DeepMind, OpenAI et Stanford AI Lab ont contribué à faire progresser les méthodes NAS, bien que de nombreux déploiements pratiques reposent encore sur des réseaux conçus manuellement en raison du coût et de la complexité.

Relation avec d'autres domaines

La NAS est étroitement liée à l'optimisation des hyperparamètres et au Meta-Learning, car elle cherche à automatiser une partie du processus de conception de modèles. Elle croise également la théorie des Neural network et la pratique du Machine learning. Les techniques utilisées dans la NAS, telles que apprentissage par renforcement et les algorithmes évolutionnaires, sont tirées de la recherche plus large en Artificial intelligence. Les stratégies d'estimation de performance exploitent souvent les techniques de Weight Initialization et de Batch Normalization pour réduire le temps d'entraînement pendant la recherche. L'objectif ultime de la NAS est de réduire l'effort humain nécessaire pour concevoir des architectures Neural network efficaces, permettant potentiellement à des non-experts de créer des modèles performants pour des tâches spécifiques.

Conclusion

La recherche d'architecture neuronale représente une étape significative vers l'automatisation de la conception de réseaux de neurones. En exploitant l'apprentissage par renforcement, les algorithmes évolutionnaires, l'optimisation bayésienne et d'autres stratégies, la NAS peut découvrir des architectures qui rivalisent ou dépassent celles conçues par l'homme. Cependant, le coût de calcul et la complexité de l'espace de recherche restent des défis clés. À mesure que les méthodes s'améliorent, la NAS est susceptible de jouer un rôle de plus en plus important dans le développement de modèles Deep learning efficaces et puissants dans divers domaines.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:automl·neural-networks·machine-learning·optimization
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique