Traduit de l'anglais

Mask R-CNN est un modèle d'apprentissage profond pour la segmentation d'instances, qui étend Faster R-CNN en ajoutant une branche de masque pour prédire des masques de segmentation au niveau des pixels, en plus des boîtes englobantes et des étiquettes de classe.

Mask R-CNN est un modèle de apprentissage profond conçu pour la segmentation d'instances, une tâche de vision par ordinateur qui identifie et délimite chaque instance d'objet dans une image au niveau du pixel. Il étend le cadre de détection d'objets Faster R-CNN en ajoutant une branche parallèle pour prédire des masques de segmentation, permettant ainsi la détection simultanée d'objets et une localisation spatiale précise. Introduit en 2017 par des chercheurs de Facebook AI Research (désormais partie de Meta), le modèle a obtenu des résultats de pointe sur le jeu de données COCO et est devenu une architecture fondatrice pour de nombreux modèles de segmentation ultérieurs.

Contrairement à la segmentation sémantique, qui classe chaque pixel en une catégorie sans distinguer les objets individuels, la segmentation d'instances nécessite de séparer les objets qui se chevauchent ou sont adjacents de la même classe. Mask R-CNN répond à cela en combinant un réseau de proposition de régions (RPN) avec une tête de prédiction de masque. Le RPN génère des boîtes englobantes candidates pour les objets, tandis que la branche de masque produit un masque binaire pour chaque région d'intérêt (RoI), en utilisant une technique appelée RoIAlign pour préserver l'alignement spatial.

Architecture

L'architecture s'appuie sur Faster R-CNN, qui étend lui-même la famille des détecteurs d'objets réseaux de neurones. Faster R-CNN utilise un backbone convolutif (tel que ResNet) pour extraire des cartes de caractéristiques, un RPN pour proposer des régions, et un classifieur pour prédire les classes d'objets et affiner les boîtes englobantes. Mask R-CNN ajoute une troisième branche qui opère en parallèle avec les têtes de classification et de régression de boîtes. Cette branche de masque est un réseau entièrement convolutif qui prédit un masque binaire pour chaque RoI, généralement à une résolution de 28×28 pixels, puis suréchantillonné à la taille de l'image d'origine.

Une innovation clé est RoIAlign, qui remplace l'opération RoIPool utilisée dans Faster R-CNN. RoIPool quantifie les limites des RoI, provoquant un désalignement entre les caractéristiques extraites et l'image d'origine. RoIAlign évite la quantification en utilisant une interpolation bilinéaire, préservant ainsi des informations spatiales précises. Cette amélioration est cruciale pour une prédiction de masque précise au pixel, car même de petits désalignements dégradent la qualité de la segmentation.

Entraînement et perte

Le modèle est entraîné de bout en bout avec une fonction de perte multi-tâches qui combine trois composantes : la perte de classification (entropie croisée), la perte de régression des boîtes englobantes (L1 lisse), et la perte de masque (entropie croisée binaire par pixel). La branche de masque n'est entraînée que sur les RoI positives (celles contenant un objet), et chaque RoI est assignée à une classe de vérité terrain spécifique, de sorte que la prédiction de masque est spécifique à la classe. Pendant l'inférence, la branche de masque s'exécute pour chaque objet détecté, et la sortie finale comprend les étiquettes de classe, les boîtes englobantes et les masques.

L'entraînement utilise généralement une descente de gradient stochastique avec momentum, initialisée avec des poids pré-entraînés sur ImageNet. Sur le jeu de données COCO, Mask R-CNN a atteint une précision moyenne (AP) de masque de 35,7 % avec un backbone ResNet-101, surpassant les méthodes antérieures telles que FCIS et le prédécesseur de Mask R-CNN, qui reposaient sur un post-traitement plus complexe. Le modèle a également démontré de fortes performances sur d'autres benchmarks, notamment Cityscapes et les tâches de segmentation d'instances en imagerie médicale.

Applications

La segmentation d'instances a des applications variées dans divers domaines. En conduite autonome, Mask R-CNN aide à identifier et séparer les piétons, les véhicules et les obstacles routiers, améliorant les systèmes de perception pour des entreprises comme Waymo et Tesla. En imagerie médicale, il segmente les tumeurs, les cellules ou les organes à partir de scans, facilitant le diagnostic et la planification chirurgicale. En robotique, il permet une manipulation précise des objets en fournissant des limites d'objets au niveau du pixel. D'autres utilisations incluent l'analyse d'images satellites, la surveillance agricole et la réalité augmentée, où des contours d'objets précis améliorent la compréhension de la scène.

La flexibilité du modèle s'étend également à la segmentation d'instances vidéo, où une cohérence temporelle est ajoutée, et à la segmentation panoptique, qui combine la segmentation d'instances et sémantique en une sortie unifiée. Des variantes telles que Mask R-CNN avec des réseaux de pyramide de caractéristiques (FPN) améliorent la précision sur les petits objets, et des backbones légers comme MobileNet permettent un déploiement sur des appareils de périphérie.

Impact et héritage

Mask R-CNN a établi une nouvelle norme pour la segmentation d'instances, influençant les architectures ultérieures telles que Cascade Mask R-CNN, Hybrid Task Cascade, et les modèles basés sur transformers comme DETR et Mask2Former. Son implémentation open-source dans le cadre Detectron2 (publié par Meta AI en 2019) a accéléré son adoption dans la recherche et l'industrie. Les principes de conception du modèle - apprentissage multi-tâches, RoIAlign et têtes de prédiction parallèles - ont été largement réutilisés dans d'autres tâches de vision, notamment la détection de points clés et la segmentation panoptique.

Malgré l'essor des modèles de type transformer de bout en bout, Mask R-CNN reste une référence robuste en raison de son efficacité et de sa précision. En 2024, il est encore utilisé dans des systèmes de production où les ressources computationnelles sont limitées, et ses concepts sont enseignés dans les cours standard de vision par ordinateur. L'article « Mask R-CNN » de Kaiming He, Georgia Gkioxari, Piotr Dollár et Ross Girshick, publié à l'ICCV 2017, a reçu des milliers de citations, reflétant son influence durable sur le domaine.

Limitations

Mask R-CNN présente des limitations connues. Il est plus lent que les détecteurs plus simples en raison de son architecture en deux étapes, rendant les applications en temps réel difficiles sans accélération matérielle. La résolution du masque est fixée à 28×28, ce qui peut perdre des détails fins pour les grands objets. Il rencontre également des difficultés avec les instances fortement chevauchantes, où le RPN peut fusionner les propositions. L'entraînement nécessite de grands jeux de données annotés avec des masques au niveau du pixel, ce qui est coûteux à produire. De plus, le modèle est sensible au changement de domaine, performant mal sur des images hors de sa distribution d'entraînement, un problème courant dans les systèmes de apprentissage automatique.

La recherche a abordé certains de ces problèmes, comme l'utilisation de masques à plus haute résolution ou de mécanismes d'attention, mais des compromis entre vitesse et précision persistent. Pour de nombreux scénarios pratiques, Mask R-CNN reste un choix fiable, équilibrant précision et coût computationnel modéré.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·instance-segmentation·deep-learning·object-detection
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique