Un moment d'image est une mesure statistique calculée à partir des intensités de pixels d'une image numérique. Il représente une moyenne pondérée des valeurs de pixels, produisant un ensemble de nombres scalaires qui décrivent les propriétés géométriques de l'image, telles que l'aire, le centroïde, l'orientation et la complexité de forme. Les moments sont invariants à certaines transformations (par exemple, translation, rotation, mise à l'échelle) lorsqu'ils sont correctement normalisés, ce qui les rend précieux pour une analyse d'image robuste. Ils servent d'outil fondamental en vision par ordinateur, permettant une représentation et une comparaison efficaces des motifs visuels sans nécessiter une correspondance pixel par pixel.
Les moments d'image sont généralement calculés à partir d'images binaires ou en niveaux de gris, où chaque pixel a une valeur d'intensité. Pour une image numérique avec une fonction d'intensité \(I(x, y)\), le moment brut d'ordre \((p+q)\) est défini comme la somme sur tous les pixels de \(x^p y^q I(x, y)\). Ces moments bruts capturent la distribution de l'intensité à travers l'image. Cependant, les moments bruts dépendent de la position de l'image, donc les moments centraux sont souvent utilisés à la place ; ils sont calculés par rapport au centroïde de l'image, offrant une invariance à la translation. Une normalisation supplémentaire produit des moments invariants à l'échelle, et des combinaisons de moments centraux peuvent générer des descripteurs invariants à la rotation, tels que les sept moments invariants de Hu introduits en 1962.
Le concept de moments d'image a des racines dans la théorie des probabilités et la mécanique, où les moments décrivent des distributions de masse. En traitement d'image, ils ont été popularisés dans les années 1960 et 1970 pour l'analyse de formes. Depuis, ils sont devenus une technique standard dans des domaines comme la détection d'objets, la reconnaissance de caractères et l'imagerie médicale. Leur simplicité de calcul et leur faible dimensionnalité les rendent adaptés aux applications en temps réel, bien qu'ils puissent perdre des détails fins par rapport à des caractéristiques plus complexes comme celles issues de l'apprentissage profond.
Applications en Vision par Ordinateur
Les moments d'image sont largement utilisés en vision par ordinateur pour des tâches nécessitant la description et la correspondance de formes. Par exemple, dans la reconnaissance optique de caractères (OCR), les moments aident à identifier les lettres et les chiffres par leurs propriétés géométriques. Dans l'inspection industrielle, ils vérifient la présence ou l'absence de défauts en comparant les moments d'une pièce fabriquée à une référence. Les moments permettent également le suivi d'objets dans des séquences vidéo, où le centroïde (dérivé des moments du premier ordre) fournit un point stable à suivre. De plus, ils sont utilisés dans le recalage d'images, où l'alignement d'images d'une même scène nécessite l'estimation de la translation et de la rotation, qui peuvent être dérivées des moments.
Types de Moments et Propriétés
Plusieurs types de moments existent, chacun avec des propriétés distinctes. Les moments bruts sont les plus simples mais ne sont pas invariants aux transformations. Les moments centraux, définis par rapport au centroïde, sont invariants à la translation. Les moments centraux normalisés, mis à l'échelle par l'aire (moment d'ordre zéro), offrent une invariance à l'échelle. Les moments de Hu, sept combinaisons non linéaires de moments centraux normalisés, sont invariants à la translation, à l'échelle et à la rotation, ce qui les rend populaires pour la reconnaissance de formes. Les moments de Zernike, introduits en 1980, utilisent des polynômes orthogonaux sur un disque unité, offrant une meilleure résilience au bruit et une redondance d'information plus faible. Les moments de Legendre, basés sur les polynômes de Legendre, fournissent également des descripteurs orthogonaux. Ces moments avancés capturent des détails d'ordre supérieur, permettant une analyse de formes plus discriminante.
Calcul et Implémentation
Le calcul des moments d'image est simple et efficace. Pour une image discrète, le moment brut d'ordre \((p+q)\) est calculé en itérant sur tous les pixels et en sommant \(x^p y^q\) fois l'intensité. Le centroïde est obtenu à partir des moments du premier ordre : \(\bar{x} = m_{10}/m_{00}\) et \(\bar{y} = m_{01}/m_{00}\), où \(m_{00}\) est l'intensité totale (aire pour les images binaires). Les moments centraux sont ensuite calculés par rapport à ce centroïde. En pratique, les moments sont souvent calculés à l'aide d'images intégrales (tables de surfaces sommées) pour obtenir un calcul en temps constant pour toute région rectangulaire, ce qui est bénéfique pour le traitement en temps réel. Des bibliothèques telles qu'OpenCV fournissent des fonctions intégrées pour le calcul des moments, simplifiant leur utilisation dans les applications.
Relation avec l'Apprentissage Automatique Moderne
Bien que les moments d'image soient des techniques classiques, ils restent pertinents à l'ère du Machine learning et du Deep learning. Ils sont parfois utilisés comme caractéristiques conçues manuellement dans des classificateurs traditionnels ou comme étapes de prétraitement pour normaliser les images avant de les alimenter dans des modèles de Neural network. Par exemple, les moments peuvent aider à aligner ou recadrer les images à une orientation standard, améliorant ainsi les performances des systèmes basés sur Convolutional neural network (CNN). Cependant, les modèles d'apprentissage profond comme Residual Network (ResNet) et U-Net apprennent généralement des caractéristiques directement à partir des pixels bruts, réduisant le besoin de calcul explicite des moments. Néanmoins, les moments restent précieux pour l'interprétabilité, car ils fournissent des résumés géométriques intuitifs qui peuvent compléter les représentations apprises. Dans les approches hybrides, les moments peuvent être combinés avec des caractéristiques apprises pour améliorer la robustesse, en particulier dans des scénarios avec des données d'entraînement limitées.
Limitations et Extensions
Les moments d'image ont des limitations. Ce sont des descripteurs globaux, ce qui signifie qu'ils résument l'image entière, ce qui peut masquer les variations locales. Pour des scènes complexes avec plusieurs objets, les moments de l'image entière ne sont pas significatifs ; à la place, les moments sont calculés par composante connexe après segmentation. De plus, les moments sont sensibles au bruit, en particulier ceux d'ordre supérieur, qui amplifient les fluctuations d'intensité. Pour atténuer cela, les moments orthogonaux comme ceux de Zernike sont préférés dans les environnements bruyants. Les extensions incluent les moments de couleur, qui calculent des moments à travers les canaux de couleur, et les moments d'ondelettes, qui combinent les moments avec une analyse multi-résolution. Ces variantes élargissent l'applicabilité des moments aux images couleur et à l'analyse multi-échelle.
En résumé, les moments d'image fournissent une manière compacte et mathématiquement fondée de décrire les formes et distributions d'images. Leurs propriétés d'invariance et leur efficacité de calcul ont assuré leur utilisation continue en vision par ordinateur, même à mesure que les méthodes modernes de Artificial intelligence évoluent. Ils servent de pont entre l'analyse d'image classique et les approches contemporaines basées sur l'apprentissage, offrant un outil simple mais puissant pour la compréhension géométrique.