Traduit de l'anglais

Faster R-CNN est un modèle d'apprentissage profond pour la détection d'objets qui intègre la génération de propositions de régions dans le réseau neuronal, améliorant vitesse et précision par rapport aux variantes antérieures du R-CNN.

Faster R-CNN est un modèle de apprentissage profond pour la détection et la localisation d'objets, introduit en juin 2015 comme une évolution de la famille R-CNN. Il génère des propositions de régions directement au sein d'une architecture de réseau de neurones, éliminant ainsi le besoin de recherche sélective externe et permettant un entraînement de bout en bout. Cette conception améliore considérablement à la fois la vitesse et la précision, ce qui en fait une méthode fondatrice en vision par ordinateur.

La famille R-CNN, développée par des chercheurs dont Ross Girshick et Kaiming He, aborde la tâche d'identification d'objets dans les images en produisant des boîtes englobantes et des étiquettes de classe. Faster R-CNN s'appuie sur ses prédécesseurs, R-CNN (novembre 2013) et Fast R-CNN (avril 2015), en intégrant l'étape de proposition dans le réseau, une innovation clé qui réduit la charge de calcul et améliore les performances en temps réel.

Architecture

Faster R-CNN se compose de deux composants principaux : un backbone convolutif (par exemple, VGG ou ResNet) qui extrait des cartes de caractéristiques de l'image d'entrée, et un réseau de proposition de régions (RPN) qui opère sur ces cartes de caractéristiques pour générer des régions candidates d'objets. Le RPN utilise un ensemble de boîtes d'ancrage de différentes échelles et ratios d'aspect pour prédire des scores d'objectness et des ajustements de boîtes englobantes. Les régions proposées sont ensuite traitées par une tête de détection, qui comprend généralement un pooling ROI et des couches entièrement connectées pour la classification et la régression des boîtes englobantes.

Contrairement aux versions antérieures qui reposaient sur la recherche sélective (un algorithme de regroupement hiérarchique) pour générer des régions d'intérêt, Faster R-CNN apprend à proposer des régions directement à partir des cartes de caractéristiques, rendant l'ensemble du pipeline différentiable et entraînable de bout en bout.

Évolution de R-CNN

La famille R-CNN a progressé à travers plusieurs versions, chacune répondant aux limitations de sa prédécesseure :

  • R-CNN (novembre 2013) : Utilisait la recherche sélective pour générer jusqu'à 2000 régions candidates, puis exécutait un CNN indépendamment sur chaque région. Cela était coûteux en calcul en raison de calculs redondants.
  • Fast R-CNN (avril 2015) : Exécutait le CNN une seule fois sur l'image entière et introduisait le pooling ROI pour extraire les caractéristiques de chaque région, améliorant considérablement la vitesse. Reposait toujours sur la recherche sélective pour les propositions.
  • Faster R-CNN (juin 2015) : Remplaçait la recherche sélective par un réseau de proposition de régions appris, rendant le système entièrement neuronal et plus rapide.
  • Mask R-CNN (mars 2017) : Étendait Faster R-CNN à la segmentation d'instances en ajoutant une branche pour les masques au niveau des pixels, et remplaçait le pooling ROI par ROIAlign pour gérer l'alignement fractionnaire des pixels.
  • Cascade R-CNN (décembre 2017) : Entraîné avec des seuils d'Intersection sur Union (IoU) progressivement croissants pour améliorer la précision de localisation.
  • Mesh R-CNN (juin 2019) : Ajoutait la capacité de générer des maillages 3D à partir d'images 2D.

Ces développements ont élargi l'applicabilité de R-CNN à des tâches telles que le suivi d'objets à partir de caméras de drones, la localisation de texte et l'intégration dans des produits comme Google Lens.

Entraînement et Performances

Faster R-CNN est entraîné en utilisant une perte multi-tâches qui combine une perte de classification (par exemple, l'entropie croisée) et une perte de régression (par exemple, L1 lisse) pour l'ajustement des boîtes englobantes. Le RPN et la tête de détection peuvent être entraînés conjointement, souvent en utilisant une optimisation alternée ou un entraînement de bout en bout avec une perte unifiée. Le modèle bénéficie de backbones pré-entraînés sur de grands ensembles de données comme ImageNet, suivis d'un ajustement fin sur des ensembles de données cibles tels que COCO ou PASCAL VOC.

En termes de performances, Faster R-CNN atteint des résultats de pointe sur les ensembles de données de référence, avec des améliorations significatives de vitesse par rapport à ses prédécesseurs. Par exemple, sur PASCAL VOC 2007, il a atteint une précision moyenne (mAP) d'environ 73,2 % tout en fonctionnant à 5 images par seconde sur un GPU, un gain substantiel par rapport à Fast R-CNN.

Applications et Impact

Faster R-CNN est devenu une pierre angulaire de la détection d'objets, influençant de nombreuses architectures ultérieures. Son mécanisme de proposition de régions a été adopté dans divers domaines, notamment la conduite autonome (par exemple, Waymo et pilote automatique Tesla), l'imagerie médicale et la robotique. La capacité du modèle à détecter des objets en temps réel a permis des applications dans la surveillance vidéo, la réalité augmentée et la recherche d'images.

De plus, la famille R-CNN a été étendue à d'autres tâches, telles que la segmentation d'instances (Mask R-CNN) et la reconstruction 3D (Mesh R-CNN). Mask R-CNN est également l'une des sept tâches du benchmark d'entraînement MLPerf, une compétition visant à accélérer l'entraînement des réseaux de neurones, soulignant son importance pratique.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:object-detection·deep-learning·computer-vision·neural-network
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique