Un réseau à fonction de base radiale (réseau RBF) est un réseau de neurones artificiels qui utilise des fonctions de base radiale comme fonctions d'activation. La sortie du réseau est une combinaison linéaire de fonctions de base radiale des entrées et des paramètres des neurones. Les réseaux RBF ont de nombreuses utilisations, notamment l'approximation de fonctions, la prédiction de séries temporelles, la classification et le contrôle de systèmes. Ils ont été formulés pour la première fois dans un article de 1988 par Broomhead et Lowe, tous deux chercheurs au Royal Signals and Radar Establishment.
Les réseaux RBF sont un type de réseau de neurones qui diffèrent des réseaux à propagation avant plus courants par leur structure de couche cachée et leur approche d'apprentissage. Ils sont étroitement liés aux méthodes de apprentissage automatique telles que la régression par noyau et les modèles de processus gaussiens, et ils ont été appliqués dans des domaines allant de l'intelligence artificielle au génie de contrôle.
Architecture du réseau
Les réseaux RBF ont généralement trois couches : une couche d'entrée, une couche cachée avec une activation non linéaire par fonction de base radiale, et une couche de sortie linéaire. L'entrée est un vecteur de nombres réels, et la sortie est une fonction scalaire de cette entrée. La sortie est calculée comme une somme pondérée de fonctions de base radiale, chacune centrée en un point spécifique de l'espace d'entrée.
Chaque neurone caché possède un vecteur de centre et un paramètre de largeur. L'activation d'un neurone ne dépend que de la distance entre l'entrée et son centre, ce qui rend la fonction radialement symétrique. La distance euclidienne est couramment utilisée, bien que la distance de Mahalanobis puisse donner de meilleurs résultats pour la reconnaissance de formes. La fonction de base radiale la plus courante est la gaussienne, qui décroît de manière lisse vers zéro à mesure que la distance au centre augmente. Cette localité signifie que la modification des paramètres d'un neurone a peu d'effet sur les entrées éloignées de son centre.
Sous des conditions modérées sur la fonction d'activation, les réseaux RBF sont des approximateurs universels sur des sous-ensembles compacts de l'espace d'entrée. Avec suffisamment de neurones cachés, ils peuvent approximer toute fonction continue sur un ensemble fermé et borné avec une précision arbitraire.
Les paramètres du réseau (poids, centres et largeurs) sont déterminés pour optimiser l'adéquation entre la sortie du réseau et les données d'apprentissage.
Normalisation
Les réseaux RBF peuvent être normalisés, auquel cas la sortie est une moyenne pondérée des sorties des neurones plutôt qu'une simple somme. Cette architecture normalisée garantit que la sortie se situe dans une plage bornée et peut améliorer la stabilité numérique. La normalisation est particulièrement utile lorsque le réseau est utilisé pour l'estimation de probabilités ou lorsque la distribution d'entrée varie.
Méthodes d'apprentissage
L'apprentissage d'un réseau RBF implique généralement deux étapes. Premièrement, les centres et les largeurs des neurones cachés sont sélectionnés, souvent en utilisant des méthodes non supervisées telles que le clustering par k-moyennes ou l'échantillonnage aléatoire à partir des données d'apprentissage. Deuxièmement, les poids de sortie sont appris, généralement en résolvant un problème de moindres carrés linéaires, ce qui est rapide et a une solution unique.
Cette approche en deux étapes contraste avec l'apprentissage basé sur le gradient utilisé dans les réseaux de apprentissage profond, où tous les paramètres sont ajustés simultanément. Les réseaux RBF peuvent également être entraînés par descente de gradient, mais la couche de sortie linéaire rend l'estimation des poids particulièrement efficace.
Applications
Les réseaux RBF sont utilisés dans une variété de tâches. En approximation de fonctions, ils peuvent modéliser des relations non linéaires complexes. En prédiction de séries temporelles, ils ont été appliqués à des données financières et météorologiques. En classification, ils servent de classifieur de apprentissage automatique, en particulier dans les problèmes de reconnaissance de formes. Ils sont également utilisés dans le contrôle de systèmes, où leur apprentissage rapide et leurs sorties lisses sont avantageux.
Comparés aux modèles de apprentissage profond, les réseaux RBF sont souvent plus simples et nécessitent moins de données, mais ils peuvent avoir du mal avec les entrées de grande dimension en raison de la malédiction de la dimensionnalité. Ils ont été utilisés dans des domaines tels que Amazon Web Services pour certaines tâches prédictives, bien que les applications modernes à grande échelle favorisent souvent des architectures plus profondes.
Limites et extensions
Une limite des réseaux RBF est que le nombre de neurones cachés peut croître de manière exponentielle avec la dimension d'entrée, ce qui les rend impraticables pour des problèmes de très haute dimension. Les extensions incluent la sélection adaptative des centres, l'utilisation de différentes fonctions de base, et des approches hybrides qui combinent des couches RBF avec d'autres types de réseaux.
Malgré l'essor des modèles basés sur les transformeurs dans la IA générative, les réseaux RBF restent un outil fondamental dans la boîte à outils des réseaux de neurones, appréciés pour leur clarté théorique et leur facilité d'apprentissage.