Traduit de l'anglais

Les eigenmoments sont une technique mathématique d'analyse d'images qui dérive des descripteurs invariants à partir des valeurs propres des matrices de moments, permettant une reconnaissance robuste de formes sous des transformations géométriques. Ils combinent les moments statistiques avec l'algèbre linéaire pour créer des caractéristiques compactes et invariantes par rotation pour les applications de vision artificielle.

Les eigenmoments sont une classe de descripteurs d'image utilisés en vision par ordinateur et en reconnaissance de formes. Ils sont construits en calculant les valeurs propres de matrices formées à partir des moments géométriques d'une image. Ces valeurs propres servent de caractéristiques invariantes à certaines transformations, notamment la rotation, ce qui les rend précieuses pour des tâches telles que la reconnaissance d'objets, l'analyse de formes et la recherche d'images. Le concept fait le pont entre la théorie classique des moments et l'algèbre linéaire, offrant une représentation compacte de la forme et de la distribution d'intensité d'une image.

Le fondement des eigenmoments repose sur l'utilisation des moments géométriques, qui sont des moyennes pondérées des intensités de pixels sur une image. Pour une fonction d'image bidimensionnelle f(x, y), le moment brut d'ordre (p+q) est défini comme m_pq = ∫∫ x^p y^q f(x, y) dx dy. Ces moments capturent des informations globales sur la forme mais sont sensibles à la translation et à l'échelle. Les eigenmoments répondent à cela en normalisant d'abord l'image à une position et une taille standard, puis en construisant une matrice de type covariance à partir de moments sélectionnés. Les valeurs propres de cette matrice sont les eigenmoments, et elles restent inchangées lorsque l'image est pivotée, car la rotation correspond à une transformation orthogonale qui préserve les valeurs propres.

La construction mathématique implique généralement des moments centraux, calculés par rapport au centroïde de l'image, garantissant l'invariance par translation. La normalisation d'échelle est obtenue en divisant les moments par une puissance du moment d'ordre zéro (masse totale). Après ces étapes de prétraitement, une matrice est formée, souvent en utilisant des moments du second ordre. Par exemple, une approche courante utilise la matrice [[μ20, μ11], [μ11, μ02]], où μpq sont des moments centraux. Les valeurs propres de cette matrice symétrique sont réelles et non négatives, et elles fournissent deux caractéristiques invariantes par rotation. Des moments d'ordre supérieur peuvent être incorporés pour créer des matrices plus grandes, produisant plus d'eigenmoments et des descripteurs plus riches.

Développement historique et contexte

Le concept d'eigenmoments a émergé à la fin du XXe siècle alors que les chercheurs cherchaient des caractéristiques robustes pour la reconnaissance automatisée d'objets. Bien que l'origine exacte ne soit pas attribuée à une seule source, la technique a gagné en popularité dans les années 1990 parallèlement aux avancées en traitement numérique des images et en apprentissage automatique. Elle faisait partie d'un effort plus large pour développer des invariants de moments, suivant les travaux antérieurs sur les sept moments invariants de Hu (introduits en 1962) qui utilisaient des combinaisons algébriques de moments pour atteindre l'invariance. Les eigenmoments offraient une approche plus systématique en exploitant la décomposition en valeurs propres, qui gère naturellement la rotation et fournit une méthode fondée pour réduire la dimensionnalité.

Des chercheurs d'institutions telles que MIT CSAIL et Carnegie Mellon University ont contribué aux fondements théoriques de la reconnaissance basée sur les moments, bien que les eigenmoments aient été spécifiquement développés à travers des études appliquées dans l'inspection industrielle et l'imagerie médicale. La méthode a trouvé un usage précoce dans la reconnaissance de caractères et l'analyse d'images satellites, où l'invariance par rotation était critique. Contrairement aux approches basées sur les réseaux neuronaux qui nécessitent de grands ensembles de données d'entraînement, les eigenmoments sont calculés directement à partir des statistiques de l'image, ce qui les rend attrayants pour les scénarios à petits échantillons.

Applications en apprentissage automatique et vision

Les eigenmoments ont été intégrés dans des pipelines d'apprentissage automatique traditionnels en tant qu'extracteurs de caractéristiques. Dans un flux de travail typique, une image est prétraitée en niveaux de gris, normalisée, puis les eigenmoments sont calculés et introduits dans des classifieurs tels que les machines à vecteurs de support ou les arbres de décision. Cette approche était courante avant l'adoption généralisée de l'apprentissage profond, car elle fournissait des caractéristiques interprétables et efficaces sur le plan computationnel. Par exemple, dans la reconnaissance de chiffres manuscrits, les eigenmoments d'ordre jusqu'à quatre pouvaient atteindre une haute précision sur des benchmarks standard, complétant des méthodes comme U-Net pour les tâches de segmentation.

À l'ère de l'Deep learning, les eigenmoments sont moins fréquemment utilisés comme caractéristiques autonomes, mais ils apparaissent encore dans des systèmes hybrides. Certains chercheurs combinent les eigenmoments avec les caractéristiques de Convolutional neural network pour améliorer la robustesse contre les distorsions géométriques. Ils sont également utilisés dans des stratégies de Data Augmentation, où la génération de versions pivotées d'images et la garantie de caractéristiques eigenmoments cohérentes aident à entraîner des modèles qui généralisent mieux. De plus, les eigenmoments servent de référence pour évaluer de nouvelles méthodes d'apprentissage de caractéristiques invariantes, en particulier dans des domaines comme l'imagerie médicale où la rotation des structures anatomiques est courante.

Propriétés mathématiques et extensions

Une propriété clé des eigenmoments est leur orthogonalité et leur compacité. Les valeurs propres sont ordonnées, et généralement seules les plus grandes sont retenues, fournissant une représentation de faible dimension qui capture les caractéristiques de forme dominantes. Cela est analogue à l'analyse en composantes principales (PCA) mais appliquée aux matrices de moments plutôt qu'aux données de pixels brutes. Le nombre d'eigenmoments utilisés est un hyperparamètre ; en utiliser trop peu perd du pouvoir discriminant, tandis qu'en utiliser trop peut introduire du bruit.

Les extensions des eigenmoments incluent les eigenmoments complexes, qui utilisent des moments à valeurs complexes pour gérer à la fois l'invariance par rotation et par réflexion. Une autre variante est l'utilisation des moments de Zernike, qui sont orthogonaux sur le disque unité et produisent des descripteurs invariants par rotation souvent supérieurs aux eigenmoments standard en termes de résilience au bruit. Cependant, les eigenmoments restent plus simples à calculer et à interpréter. Les chercheurs ont également exploré la combinaison des eigenmoments avec la Batch Normalization et d'autres techniques de normalisation pour stabiliser les distributions de caractéristiques dans les systèmes d'apprentissage.

Comparaison avec des descripteurs alternatifs

Les eigenmoments sont souvent comparés à d'autres descripteurs invariants tels que les moments de Hu, les descripteurs de Fourier et la transformée de caractéristiques invariantes à l'échelle (SIFT). Les moments de Hu sont computationnellement plus légers mais moins discriminants pour les formes complexes. Les descripteurs de Fourier capturent les informations de contour mais nécessitent l'extraction du contour. Les caractéristiques SIFT sont très robustes à l'échelle et à la rotation mais sont locales et nécessitent la détection de points clés, ce qui les rend plus coûteuses. Les eigenmoments offrent un juste milieu : globaux, compacts et invariants par rotation, mais ils sont sensibles au bruit et à l'occlusion, car ils résument l'image entière.

En termes pratiques, les eigenmoments excellent dans des scénarios avec des objets propres et bien segmentés. Ils sont moins adaptés aux scènes encombrées où des caractéristiques locales sont nécessaires. Le choix entre les eigenmoments et les caractéristiques d'apprentissage profond dépend souvent de la disponibilité des données et des contraintes computationnelles. Pour de petits ensembles de données, les eigenmoments peuvent surpasser les réseaux neuronaux car ils ne nécessitent pas d'entraînement extensif. Pour de grands ensembles de données, les caractéristiques profondes apprises par des modèles comme Residual Network (ResNet) tendent à être plus expressives.

Pertinence actuelle et directions futures

Bien que l'apprentissage profond domine la vision par ordinateur moderne, les eigenmoments conservent leur pertinence dans des applications spécialisées. Ils sont utilisés dans les systèmes embarqués et le traitement en temps réel où les ressources computationnelles sont limitées, comme dans la robotique et les véhicules autonomes. Par exemple, Waymo et Tesla s'appuient sur l'apprentissage profond pour la perception, mais des caractéristiques légères basées sur les moments peuvent servir de solutions de secours ou pour des tâches spécifiques comme la détection de marquage de voie. Dans l'inspection industrielle, les eigenmoments sont employés par des entreprises comme Intuitive Surgical pour le suivi des instruments dans les robots chirurgicaux, où l'invariance par rotation est cruciale.

Les recherches futures pourraient explorer l'intégration des eigenmoments avec les architectures Transformer (architecture), en les utilisant comme priors positionnels ou structurels. Il y a également un intérêt pour l'apprentissage de caractéristiques basées sur les moments de bout en bout dans les réseaux neuronaux, améliorant potentiellement l'interprétabilité. À partir du milieu des années 2020, les eigenmoments ne sont pas un sujet dominant dans les conférences d'IA de premier plan, mais ils persistent dans les manuels et l'ingénierie appliquée. Leur élégance mathématique garantit qu'ils restent un concept fondamental pour les étudiants et les praticiens en traitement d'images et en reconnaissance de formes.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·image-processing·mathematics·pattern-recognition
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique