La soustraction de fond est une technique fondamentale en vision par ordinateur et en traitement vidéo qui sépare les objets mobiles de premier plan d'un arrière-plan relativement statique dans une séquence d'images. L'idée centrale est de construire un modèle statistique ou heuristique de la scène de fond, puis de classer chaque pixel d'une nouvelle image comme appartenant soit au fond (s'il correspond au modèle), soit au premier plan (s'il s'en écarte significativement). Cette méthode sous-tend de nombreuses applications, notamment la surveillance vidéo, le suivi du trafic, l'interaction homme-machine et le suivi d'objets, où l'objectif est d'identifier les régions d'intérêt sans connaissance préalable de l'apparence des objets.
L'approche suppose que la caméra est stationnaire et que le fond est généralement invariant dans le temps, bien que des variations telles que des changements progressifs d'éclairage, le bruit de la caméra et de petits mouvements répétitifs (par exemple, le balancement des feuilles d'arbres) doivent être gérés. La soustraction de fond se distingue des méthodes de segmentation plus récentes basées sur l'apprentissage profond, car elle opère typiquement sur des statistiques par pixel plutôt que sur des caractéristiques sémantiques apprises, ce qui la rend efficace en calcul et adaptée aux systèmes temps réel sur matériel embarqué.
Développement historique
Les origines de la soustraction de fond remontent aux années 1970 et 1980, lorsque les premiers systèmes d'analyse vidéo utilisaient une simple différence d'images - soustrayant des images consécutives pour détecter les changements. Une avancée majeure est survenue en 1997 avec les travaux de Chris Stauffer et W.E.L. Grimson au MIT Computer Science and Artificial Intelligence Laboratory, qui ont modélisé chaque pixel comme un mélange de distributions gaussiennes. Cette approche adaptative pouvait gérer des fonds multimodaux, tels que des écrans scintillants ou des surfaces d'eau, et est devenue la norme de facto pendant plus d'une décennie.
Des raffinements ultérieurs ont inclus l'algorithme de codebook de Kim et al. (2004), qui compressait les échantillons de fond en mots de code pour l'efficacité mémoire, et la méthode ViBe (Visual Background Extractor) introduite par Olivier Barnich et Marc Van Droogenbroeck en 2011, qui utilisait une politique aléatoire pour mettre à jour les échantillons de fond, atteignant une vitesse élevée avec un faible coût de calcul. Dans les années 2010, la recherche s'est orientée vers l'intégration de caractéristiques de couleur, de texture et de contours pour améliorer la robustesse contre les ombres et les changements d'éclairage.
Techniques principales
Un pipeline simple de soustraction de fond commence par l'initialisation du fond, où les N premières images sont utilisées pour estimer le modèle initial. La forme la plus basique est la moyenne mobile, où la valeur de fond de chaque pixel est mise à jour comme B_t = (1 - alpha) B_{t-1} + alpha I_t, avec alpha comme taux d'apprentissage. La détection du premier plan applique ensuite un seuil : si |I_t - B_t| > T, le pixel est marqué comme premier plan. Cela fonctionne bien dans des environnements contrôlés mais échoue dans des conditions dynamiques.
Des méthodes plus sophistiquées incluent le modèle de mélange gaussien (GMM), qui maintient K distributions gaussiennes par pixel, chacune avec un poids, une moyenne et une variance. Un pixel est classé comme fond s'il correspond à une distribution dans un certain nombre d'écarts types. Les paramètres sont mis à jour en ligne à l'aide d'une procédure similaire à l'espérance-maximisation. Une autre approche populaire est l'estimation de densité par noyau non paramétrique, qui utilise un histogramme des valeurs récentes de pixels pour estimer la densité de probabilité, permettant des distributions de fond arbitraires sans supposer une forme paramétrique spécifique.
Défis et approches modernes
Les scènes réelles posent plusieurs défis : changements soudains d'éclairage (par exemple, passage de nuages), ombres projetées par des objets de premier plan, tremblement de caméra et objets de fond qui commencent à bouger (par exemple, une voiture garée qui s'éloigne). Les ombres sont particulièrement problématiques car elles partagent la même texture que le fond mais ont une luminosité plus faible. De nombreux algorithmes intègrent des espaces de couleur comme HSV pour séparer la chrominance de la luminance, ou utilisent des caractéristiques basées sur les gradients pour distinguer les ombres du véritable premier plan.
Depuis le milieu des années 2010, les approches de apprentissage automatique et de réseaux de neurones ont gagné en popularité. Les réseaux de neurones convolutifs, en particulier les variantes de l'architecture U-Net, ont été entraînés sur des ensembles de données étiquetés comme CDnet 2014 pour effectuer une segmentation du premier plan au niveau du pixel. Ces méthodes apprennent à supprimer les ombres et à gérer les fonds dynamiques plus efficacement que les techniques classiques, mais elles nécessitent de grands ensembles de données annotés et des ressources de calcul importantes. Les systèmes hybrides combinent souvent une méthode classique rapide pour la détection initiale avec un modèle profond pour le raffinement, équilibrant vitesse et précision.
Applications
La soustraction de fond est largement déployée dans les systèmes de sécurité et de surveillance, où elle détecte les intrus ou les objets abandonnés dans des flux de caméras fixes. Dans la gestion du trafic, elle compte les véhicules et estime les vitesses sur les autoroutes. Dans l'analyse du mouvement humain, elle isole la silhouette d'une personne pour la reconnaissance de la démarche ou le contrôle gestuel, comme utilisé dans les premiers systèmes interactifs. La technique apparaît également en imagerie médicale pour soustraire les images pré-contraste des images post-contraste, et en astronomie pour éliminer le fond statique du ciel des images de télescope.
Dans les environnements industriels, la soustraction de fond permet l'inspection qualité sur les chaînes d'assemblage, détectant les défauts ou les objets étrangers sur un tapis roulant. Avec l'essor de l'informatique de périphérie, les implémentations sur des dispositifs à faible consommation comme ceux de ARM ou Qualcomm permettent un traitement temps réel dans les drones et les caméras intelligentes, étendant la portée de la technique au-delà des systèmes traditionnels basés sur serveur.
Évaluation et ensembles de données
L'évaluation comparative est essentielle pour comparer les algorithmes. Les ensembles de données CDnet 2012 et CDnet 2014, créés par l'Université de Montréal, fournissent un ensemble diversifié de séquences vidéo avec des annotations de vérité terrain au niveau du pixel, couvrant des catégories comme la ligne de base, le fond dynamique, le mouvement intermittent et l'ombre. Les métriques incluent la précision, le rappel, la mesure F et le pourcentage de classifications erronées. L'édition 2014 a introduit 11 catégories avec 53 vidéos, devenant la norme pour l'évaluation académique.
Des efforts plus récents, comme l'ensemble de données LASIESTA, ajoutent des scénarios synthétiques et réels avec une difficulté variable. Bien que les modèles d'apprentissage profond atteignent souvent des mesures F plus élevées sur ces références, les méthodes classiques restent compétitives en vitesse et sont préférées lorsque les données d'entraînement sont rares ou lorsque l'interprétabilité est requise. Le choix de l'algorithme dépend en fin de compte des contraintes spécifiques de l'application, y compris les limites matérielles, les exigences temps réel et la variabilité attendue de la scène.
Voir aussi
- augmentation de données
- réseau résiduel
- vision par ordinateur (note : non inclus dans la liste de slugs fournie, donc omis)
- apprentissage automatique