Un réseau de pyramides de caractéristiques (FPN) est une architecture de réseau neuronal conçue pour extraire des cartes de caractéristiques multi-échelles pour la détection d'objets et d'autres tâches de vision par ordinateur. Introduit par Tsung-Yi Lin, Piotr Dollár, Ross Girshick, Kaiming He, Bharath Hariharan et Serge Belongie dans leur article de 2017 « Feature Pyramid Networks for Object Detection », le FPN répond au défi de détecter des objets à différentes échelles en construisant une pyramide de cartes de caractéristiques avec des informations sémantiques riches à chaque niveau. Il est devenu un composant fondamental de nombreux détecteurs modernes, tels que Faster R-CNN et Mask R-CNN, et est largement utilisé dans les applications de apprentissage automatique et de apprentissage profond.
L'idée centrale du FPN est d'exploiter les représentations de caractéristiques hiérarchiques multi-échelles inhérentes à un réseau de neurones convolutif (généralement un réseau de base comme ResNet) et de les améliorer avec un cheminement de haut en bas qui propage les caractéristiques sémantiques de haut niveau vers les résolutions inférieures. Cela est réalisé grâce à des connexions latérales qui fusionnent les cartes de caractéristiques correspondantes du cheminement de bas en haut, permettant au réseau de produire des caractéristiques robustes à chaque échelle. En conséquence, le FPN améliore les performances de détection, en particulier pour les petits objets, sans augmenter significativement le coût de calcul.
Architecture
Le FPN se compose de deux cheminements principaux : un cheminement de bas en haut et un cheminement de haut en bas. Le cheminement de bas en haut est le réseau convolutif standard à propagation avant (par exemple, ResNet) qui calcule des cartes de caractéristiques à plusieurs échelles, généralement avec des pas de 4, 8, 16 et 32 pixels par rapport à l'image d'entrée. Ces cartes de caractéristiques sont désignées par C2, C3, C4 et C5, correspondant aux sorties des derniers blocs résiduels à chaque étape.
Le cheminement de haut en bas génère des cartes de caractéristiques à plus haute résolution en suréchantillonnant des caractéristiques spatialement plus grossières mais sémantiquement plus fortes provenant des couches supérieures. Chaque carte de caractéristiques suréchantillonnée est ensuite fusionnée avec la carte de caractéristiques correspondante de bas en haut via une couche convolutive 1x1 (pour réduire les dimensions des canaux) suivie d'une addition élément par élément. Le résultat fusionné passe par une convolution 3x3 pour produire la carte de caractéristiques finale pour cette échelle, désignée par P2, P3, P4 et P5. Ces cartes de caractéristiques sont utilisées pour la détection d'objets, chaque niveau étant responsable de la détection d'objets d'une certaine plage de tailles.
Applications
Le FPN a été largement adopté dans les cadres de détection d'objets. Dans Faster R-CNN, le FPN est utilisé comme extracteur de caractéristiques pour le réseau de propositions de régions (RPN) et le classificateur basé sur les ROI qui suit, permettant au modèle de gérer efficacement des objets de tailles variées. Mask R-CNN étend le FPN pour la segmentation d'instances, en utilisant les caractéristiques multi-échelles pour générer des masques de segmentation. Le FPN bénéficie également à d'autres tâches telles que la segmentation sémantique et la détection de points clés, où le contexte multi-échelle est crucial.
Au-delà de la détection, le FPN a inspiré des architectures similaires dans d'autres domaines, comme U-Net pour la segmentation d'images biomédicales, qui utilise également un encodeur-décodeur symétrique avec des connexions de saut. Cependant, la conception spécifique du FPN avec ses connexions latérales et sa fusion de haut en bas s'est avérée particulièrement efficace pour les tâches de détection.
Variantes et améliorations
Plusieurs variantes du FPN ont été proposées pour améliorer son efficacité et sa précision. Par exemple, BiFPN (Bidirectional Feature Pyramid Network) utilisé dans EfficientDet introduit une fusion de caractéristiques bidirectionnelle pondérée, permettant au réseau d'apprendre l'importance des différentes caractéristiques d'entrée. Une autre variante, PANet (Path Aggregation Network), ajoute une augmentation supplémentaire du cheminement de bas en haut pour raccourcir le chemin d'information entre les caractéristiques de bas niveau et de haut niveau. Ces améliorations ont fait progresser l'état de l'art en détection d'objets sur des références comme COCO.
Impact et héritage
Le FPN a eu un impact durable sur le domaine de la vision par ordinateur. Son introduction a marqué un passage de l'utilisation de caractéristiques à échelle unique à des pyramides de caractéristiques multi-échelles, ce qui est désormais une pratique standard dans les architectures de détection. L'article a été cité des milliers de fois et a influencé les recherches ultérieures sur la conception de réseaux résiduels et la fusion de caractéristiques. Les principes du FPN sont également appliqués dans d'autres domaines, tels que les stratégies de augmentation de données qui simulent des variations d'échelle pendant l'entraînement.
En résumé, le réseau de pyramides de caractéristiques est une innovation architecturale clé qui permet une détection d'objets multi-échelles robuste, et son influence s'étend à de nombreuses architectures modernes de vision par ordinateur.