Segmentation d'instances

Traduit de l'anglais

La segmentation d'instance est une tâche de vision par ordinateur qui détecte et délimite chaque instance d'objet distincte dans une image, en attribuant une étiquette unique à chaque pixel appartenant à un objet.

La segmentation d'instances est une tâche de vision par ordinateur qui combine la détection d'objets et la segmentation sémantique pour identifier et délimiter chaque instance d'objet distincte dans une image. Contrairement à la segmentation sémantique, qui attribue une seule étiquette à tous les pixels d'une même classe, la segmentation d'instances attribue une étiquette unique à chaque objet individuel, permettant ainsi de séparer avec précision des objets qui se chevauchent ou qui sont adjacents mais appartiennent à la même catégorie. Cette capacité est essentielle dans des applications allant de la conduite autonome et de l'imagerie médicale à la robotique et à la réalité augmentée.

La tâche est généralement formulée comme un problème de classification au niveau du pixel, où chaque pixel se voit attribuer à la fois une étiquette de classe et un identifiant d'instance. Les approches modernes reposent fortement sur l'apprentissage profond, en particulier sur les réseaux de neurones convolutifs et les architectures basées sur les transformeurs, pour atteindre des performances de pointe. La segmentation d'instances est l'un des trois principaux groupes de segmentation d'image, avec la segmentation sémantique et la segmentation panoptique, qui combine les deux en classifiant chaque pixel et en distinguant les instances pour les classes comptables.

Contexte historique

La segmentation d'instances est issue de travaux antérieurs sur la segmentation d'image et la détection d'objets. Les techniques classiques de vision par ordinateur, telles que le seuillage, le regroupement en grappes et la détection de contours, ont jeté les bases méthodologiques mais ne permettaient pas de séparer les instances individuelles. L'avènement de l'apprentissage profond, en particulier le succès des réseaux de neurones convolutifs régionaux (R-CNN) vers 2014, a marqué un tournant en permettant la détection et la segmentation simultanées. L'architecture Mask R-CNN, introduite en 2017 par Kaiming He et ses collègues chez Facebook AI Research, a étendu Faster R-CNN en ajoutant une branche de prédiction de masques, devenant ainsi une référence dans le domaine. Par la suite, des modèles comme YOLACT ont permis une segmentation d'instances en temps réel, tandis que des architectures basées sur les transformeurs, telles que Mask2Former, ont unifié les tâches de segmentation sémantique et d'instances.

Techniques principales

Les approches classiques de segmentation d'instances comprennent le seuillage, la méthode la plus simple qui convertit une image en niveaux de gris en image binaire en choisissant une valeur de seuil, avec des variantes comme la méthode d'Otsu. Les algorithmes de regroupement en grappes, tels que k-means et mean shift, partitionnent les pixels en groupes homogènes en fonction de la couleur, de la texture ou d'autres caractéristiques, mais ne distinguent pas intrinsèquement les instances. La segmentation par mouvement utilise les différences entre trames consécutives pour isoler les objets en mouvement, une technique démontrée dans les systèmes de segmentation interactifs.

Les méthodes modernes d'apprentissage profond dominent le domaine. Les détecteurs en deux étapes, comme Mask R-CNN, proposent d'abord des régions candidates, puis prédisent des masques à l'intérieur de chaque région. Les méthodes en une étape, telles que YOLACT et SOLO, prédisent directement les masques sans proposition de région, offrant ainsi une inférence plus rapide. Les architectures basées sur les transformeurs, notamment DETR et Mask2Former, abordent la segmentation d'instances comme un problème de prédiction d'ensemble, en utilisant des mécanismes d'attention pour capturer le contexte global de l'image. Ces modèles sont entraînés sur de grands ensembles de données annotés, comme COCO, qui contient plus de 200 000 images avec des masques au niveau de l'instance.

Applications

La segmentation d'instances a de nombreuses applications pratiques. En imagerie médicale, elle permet la segmentation des noyaux cellulaires dans les images histopathologiques, facilitant le comptage des cellules, l'extraction de caractéristiques morphologiques et le classement des tumeurs. Elle est également utilisée pour localiser les tumeurs, mesurer les volumes tissulaires et planifier des interventions chirurgicales. Dans le domaine de la conduite autonome, la segmentation d'instances aide à détecter et à suivre les piétons, les véhicules et les obstacles, améliorant ainsi les systèmes de sécurité. D'autres applications incluent l'analyse d'images satellite pour localiser les routes, les forêts et les cultures, la surveillance vidéo pour le suivi d'objets, et la recherche d'images par le contenu. En robotique, la segmentation d'instances est essentielle pour la manipulation d'objets et la compréhension de la scène.

Défis et orientations futures

Malgré les progrès accomplis, la segmentation d'instances reste confrontée à plusieurs défis. La gestion des objets qui se chevauchent ou qui sont fusionnés, comme dans les scènes bondées ou les cellules en contact, demeure difficile. Le besoin de grandes quantités de données annotées constitue un goulot d'étranglement, en particulier dans des domaines spécialisés comme l'imagerie médicale où les annotations d'experts sont rares. Les performances en temps réel sont également une préoccupation pour des applications comme la conduite autonome et la robotique. Les recherches futures se concentrent sur l'amélioration de l'efficacité, la réduction des exigences d'annotation grâce à l'apprentissage semi-supervisé et à l'apprentissage en quelques exemples, et l'intégration de la segmentation d'instances avec d'autres tâches comme la segmentation panoptique pour une compréhension complète de la scène. En 2025, les modèles basés sur les transformeurs sont de plus en plus privilégiés pour leur flexibilité et leur précision.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·image-segmentation·deep-learning
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique