Traduit de l'anglais

Fast R-CNN est un modèle de détection d'objets qui améliore R-CNN en exécutant le réseau neuronal une seule fois par image et en utilisant le ROIPooling pour classer les régions, ce qui accélère considérablement l'entraînement et l'inférence.

Fast R-CNN est un modèle de Machine learning pour la détection et la localisation d'objets, introduit en avril 2015 comme une amélioration par rapport au R-CNN original. Il appartient à la famille des réseaux de neurones convolutifs basés sur les régions (R-CNN), qui visent à identifier des objets dans les images en générant des boîtes englobantes et des étiquettes de catégories. Fast R-CNN résout une inefficacité clé de son prédécesseur en exécutant le Neural network sous-jacent une seule fois sur l'image entière, plutôt que séparément sur chacun des milliers de régions candidates, ce qui permet un entraînement et une inférence plus rapides tout en maintenant la précision.

Le modèle a été développé par Ross Girshick, en s'appuyant sur des travaux antérieurs avec R-CNN. Il utilise un algorithme de recherche sélective pour proposer des régions d'intérêt (ROI), qui sont ensuite traitées par un réseau convolutif. Un module dédié de ROIPooling extrait des cartes de caractéristiques de taille fixe pour chaque ROI, qui sont ensuite classifiées et affinées pour la régression des boîtes englobantes. Cette conception réduit considérablement la redondance computationnelle par rapport à R-CNN, qui calculait indépendamment les caractéristiques pour chaque ROI.

Architecture

L'architecture de Fast R-CNN se compose d'un réseau de base convolutif (par exemple, VGG16) qui traite l'image d'entrée une seule fois, produisant une carte de caractéristiques. La recherche sélective génère jusqu'à 2000 propositions de régions à partir de l'image. Chaque proposition est mappée à une région de la carte de caractéristiques, et ROIPooling divise cette région en une grille fixe (par exemple, 7x7), appliquant un max pooling pour produire une sortie de taille fixe. Ces caractéristiques regroupées sont alimentées dans des couches entièrement connectées qui produisent des probabilités de classes softmax et des décalages de boîtes englobantes. Le réseau entier est entraîné de bout en bout en utilisant une perte multi-tâches combinant classification et régression.

Contrairement au R-CNN original, qui nécessitait une étape d'entraînement séparée pour chaque composant, Fast R-CNN optimise conjointement toutes les couches, simplifiant le pipeline d'entraînement. L'utilisation de ROIPooling permet aux gradients de circuler à travers les propositions de régions pendant la rétropropagation, permettant un apprentissage efficace.

Améliorations par rapport à R-CNN

L'amélioration principale de Fast R-CNN est l'efficacité computationnelle. R-CNN traitait chacune des 2000 ROI à travers le CNN indépendamment, entraînant une énorme redondance de calcul. Fast R-CNN partage le calcul convolutif à travers toutes les ROI, réduisant le temps d'entraînement de jours à heures et accélérant l'inférence de plus de 200 fois. De plus, Fast R-CNN utilise une perte multi-tâches qui optimise simultanément la classification et la régression des boîtes englobantes, améliorant la précision de localisation par rapport aux étapes d'entraînement séparées de R-CNN.

Un autre changement notable est l'utilisation d'un classifieur softmax au lieu des machines à vecteurs de support (SVM) utilisées dans R-CNN, simplifiant le modèle et améliorant les performances. La couche ROIPooling permet également un entraînement de bout en bout, ce qui n'était pas possible dans le R-CNN original en raison de sa procédure d'entraînement disjointée.

Impact et héritage

Fast R-CNN a été une étape importante dans la détection d'objets, influençant les modèles ultérieurs. Il a été suivi par Faster R-CNN en juin 2015, qui a remplacé la recherche sélective par un réseau de proposition de régions intégré au réseau neuronal, améliorant encore la vitesse et la précision. Les extensions ultérieures incluent Mask R-CNN (mars 2017) pour la segmentation d'instances, Cascade R-CNN (décembre 2017) pour une localisation améliorée avec des seuils IoU croissants, et Mesh R-CNN (juin 2019) pour la génération de maillages 3D. La famille R-CNN a été appliquée à des tâches telles que le suivi d'objets à partir de caméras de drones, la localisation de texte et l'alimentation de Google Lens.

L'architecture de Fast R-CNN, en particulier ROIPooling, a influencé de nombreux frameworks de détection ultérieurs. Ses principes de calcul partagé et d'entraînement de bout en bout sont désormais standard dans les détecteurs d'objets modernes, y compris ceux utilisés dans les applications de Deep learning.

Entraînement et performances

Fast R-CNN est entraîné sur des ensembles de données comme PASCAL VOC et COCO, en utilisant une descente de gradient stochastique avec un calendrier de taux d'apprentissage. Il utilise généralement un réseau pré-entraîné (par exemple, VGG16) affiné sur l'ensemble de données cible. Le modèle atteint une haute précision moyenne (mAP) sur les ensembles de référence, avec des accélérations significatives par rapport à R-CNN. Par exemple, sur PASCAL VOC 2012, Fast R-CNN a atteint une mAP de 66 % tout en étant environ 25 fois plus rapide à l'inférence que R-CNN.

Le processus d'entraînement implique l'échantillonnage de ROI à partir d'un petit nombre d'images par lot, en équilibrant les exemples positifs et négatifs. La perte multi-tâches pondère la classification et la régression, avec des hyperparamètres ajustés pour des performances optimales. L'efficacité de Fast R-CNN l'a rendu pratique pour des applications réelles, contribuant à son adoption généralisée dans la recherche en vision par ordinateur et dans l'industrie.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:object-detection·computer-vision·deep-learning·rcnn
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique