Segmentation sémantique

Traduit de l'anglais

La segmentation sémantique est une tâche de vision par ordinateur qui attribue une étiquette de classe à chaque pixel d'une image, regroupant les pixels en régions partageant une signification sémantique commune. C'est une technique clé pour la compréhension de scène, utilisée dans des applications telles que la conduite autonome et l'imagerie médicale.

La segmentation sémantique est une tâche de vision par ordinateur qui attribue une étiquette de classe à chaque pixel d'une image, partitionnant ainsi l'image en régions correspondant à des catégories sémantiques telles que « personne », « route » ou « arrière-plan ». Contrairement à la segmentation d'instances, qui distingue les objets individuels d'une même classe, la segmentation sémantique traite tous les pixels d'une classe donnée comme une seule unité. C'est un problème fondamental en intelligence artificielle et en apprentissage automatique, reliant le traitement d'image de bas niveau à la compréhension de scène de haut niveau.

L'objectif de la segmentation sémantique est de produire une carte de classification dense, pixel par pixel, qui simplifie l'image en régions significatives. Cette sortie est généralement utilisée comme entrée pour des tâches de niveau supérieur telles que la détection d'objets, l'analyse de scène et la navigation autonome. La technique a évolué des méthodes classiques de vision par ordinateur aux approches modernes de apprentissage profond, qui ont considérablement amélioré la précision et la robustesse.

Développement historique

Les premières méthodes de segmentation d'image reposaient sur des techniques classiques de vision par ordinateur. Le seuillage, l'une des approches les plus simples, convertit une image en niveaux de gris en une image binaire en sélectionnant une valeur de seuil ; les méthodes populaires incluent la méthode d'Otsu, l'entropie maximale et le seuillage par histogramme équilibré. Les méthodes de regroupement, telles que K-means et le décalage moyen, partitionnent les pixels en fonction de la couleur, de l'intensité ou de la texture. Ces approches classiques nécessitaient souvent un réglage spécifique au domaine et peinaient avec des scènes complexes.

L'avènement des architectures de réseaux de neurones, en particulier les réseaux de neurones convolutifs (CNN), a révolutionné la segmentation sémantique. Un modèle marquant, le réseau entièrement convolutif (FCN), introduit en 2015, a remplacé les couches entièrement connectées par des couches convolutives, permettant une prédiction dense de bout en bout. Des architectures ultérieures comme U-Net, conçue pour la segmentation d'images biomédicales, et DeepLab, avec sa convolution atrous et son pooling pyramidal spatial, ont encore fait progresser le domaine. Ces modèles exploitent le apprentissage profond pour apprendre des caractéristiques hiérarchiques, obtenant des résultats de pointe.

Techniques et architectures clés

La segmentation sémantique moderne repose sur des architectures d'apprentissage profond qui traitent les images à plusieurs échelles. Les structures encodeur-décodeur, telles que U-Net, capturent le contexte par un chemin de contraction et récupèrent les détails spatiaux par un chemin d'expansion. Les convolutions atrous (dilatées), utilisées dans DeepLab, permettent un champ réceptif plus large sans augmenter les paramètres. Les mécanismes d'attention, y compris les modèles basés sur les transformeurs, ont été adaptés pour la segmentation, permettant une modélisation globale du contexte.

L'entraînement de ces modèles nécessite de grands ensembles de données annotés, tels que PASCAL VOC, Cityscapes et COCO. Des fonctions de perte comme l'entropie croisée et la perte Dice sont couramment utilisées pour gérer le déséquilibre des classes. L'augmentation des données et le transfert d'apprentissage à partir de backbones pré-entraînés (par exemple, ResNet) sont des pratiques standard. Les exigences computationnelles des modèles de segmentation ont stimulé des innovations matérielles, y compris des accélérateurs spécialisés - cependant, selon les sources fournies, aucun matériel spécifique n'est mentionné ; à la place, une infrastructure générale de apprentissage profond est implicite.

Applications

La segmentation sémantique a de larges applications dans diverses industries. En imagerie médicale, elle est utilisée pour localiser les tumeurs, mesurer les volumes tissulaires et planifier les chirurgies, souvent appliquée à la tomodensitométrie (CT), à l'imagerie par résonance magnétique (IRM) et à la microscopie électronique. Par exemple, la segmentation d'instances de noyaux dans des images de lames entières aide en pathologie numérique et en histopathologie, permettant le comptage cellulaire et le classement des tumeurs.

Dans la conduite autonome, la segmentation sémantique aide à identifier les routes, les véhicules, les piétons et les panneaux de signalisation, ce qui est essentiel pour une navigation sûre. Des entreprises comme Waymo et Tesla Autopilot s'appuient sur de tels systèmes de perception. D'autres applications incluent l'analyse d'images satellites pour cartographier les routes et les cultures, la surveillance vidéo pour la détection d'objets et la recherche d'images par contenu. La technique est également utilisée en robotique pour la compréhension de scène et la manipulation.

Défis et orientations futures

Malgré les progrès, la segmentation sémantique fait face à des défis. Le déséquilibre des classes, où les pixels d'arrière-plan dominent, peut biaiser les modèles. Les frontières ambiguës et les occlusions restent difficiles. La segmentation en temps réel pour les systèmes embarqués nécessite des architectures efficaces et une optimisation matérielle. Ces dernières années, la recherche se concentre sur la segmentation few-shot et zero-shot, exploitant les architectures de grands modèles de langage et de transformeurs pour généraliser à des classes non vues. L'intégration de la segmentation sémantique avec la IA générative et les modèles multimodaux est une tendance émergente, permettant des systèmes plus flexibles et interactifs.

Les orientations futures incluent l'amélioration de la robustesse aux changements de domaine, la réduction des coûts d'annotation grâce à l'apprentissage auto-supervisé et le déploiement de modèles sur des appareils de périphérie. Le domaine continue d'évoluer, stimulé par les avancées en apprentissage profond et la disponibilité croissante des ressources computationnelles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·image-segmentation·deep-learning·semantic-segmentation
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique