Traduit de l'anglais

Une carte de saillance est une image mettant en évidence les régions les plus importantes visuellement pour la perception humaine ou pour les modèles d’apprentissage automatique, souvent calculée à partir de gradients ou d’attention. C’est un outil clé de l’IA explicable pour interpréter les réseaux de neurones profonds.

Une carte de saillance est une représentation visuelle qui met en évidence les régions d'une image les plus pertinentes pour une tâche donnée, que ce soit pour l'attention visuelle humaine ou pour les décisions d'un modèle d'apprentissage automatique. En vision par ordinateur, ces cartes reflètent le degré d'importance de chaque pixel pour le système visuel humain ou pour un modèle autrement opaque. Par exemple, dans une photographie, un observateur pourrait d'abord regarder un fort ou des nuages légers ; une carte de saillance de cette image éclaircirait ces régions pour indiquer leur proéminence. Alors que les cartes de saillance basées sur le suivi oculaire se rapprochent du regard humain, les cartes de saillance basées sur les gradients en apprentissage automatique révèlent où un modèle se concentre lorsqu'il fait une prédiction.

Dans le contexte de l'intelligence artificielle, les cartes de saillance sont devenues un outil central de l'IA explicable. Elles fournissent des explications visuelles de la manière dont les réseaux de neurones profonds arrivent à des décisions en mettant en évidence les pixels ou caractéristiques d'entrée qui influencent le plus la sortie. Cette technique est particulièrement courante pour la classification d'images et la détection d'objets, mais elle s'étend aux architectures de transformeurs ultérieures grâce aux cartes d'attention. Le concept fait le pont entre les sciences cognitives et l'apprentissage automatique, et ses racines dans la vision humaine ont façonné à la fois les approches algorithmiques et les méthodes d'évaluation.

Saillance Visuelle Humaine

Les cartes de saillance humaines visent à prédire les emplacements qui attirent l'attention d'une personne en premier. Le cortex visuel primaire (V1) semble être responsable de la carte de saillance, selon l'hypothèse de saillance V1, ce qui rend la saillance un phénomène biologiquement fondé. Les modèles computationnels de saillance humaine reposent souvent sur des caractéristiques de bas niveau telles que la couleur, le contraste, les contours et le mouvement.

Les applications les plus courantes dans ce domaine sont :

  • Compression d'images et de vidéos : L'œil humain se concentre uniquement sur une petite région d'intérêt dans une image ; utiliser une carte de saillance permet d'encoder à une qualité inférieure en dehors de cette région, réduisant la taille du fichier sans perte perçue.
  • Évaluation de la qualité d'images et de vidéos : Des métriques de qualité qui pondèrent davantage les différences dans les régions saillantes, obtenant une corrélation plus élevée avec les opinions humaines subjectives.
  • Redimensionnement d'images : Redimensionner les images en élargissant ou en rétrécissant les régions non informatives pour préserver le contenu important, en s'appuyant sur des estimations précises de saillance.
  • Détection et reconnaissance d'objets : Plutôt que d'appliquer des algorithmes complexes à l'intégralité d'une image, ceux-ci sont appliqués aux régions les plus saillantes, qui contiennent probablement les objets à reconnaître.

Les algorithmes d'estimation classiques se déclinent en trois types principaux, tels qu'implémentés dans OpenCV : la saillance statique (basée sur les caractéristiques et statistiques de l'image), la saillance de mouvement (basée sur le mouvement du flux optique, où les objets en mouvement sont saillants) et l'objectness (qui fournit des boîtes englobantes autour des objets probables). Il existe également une méthode statique plus récente appelée sensibilité à la distorsion visuelle, qui traite les vrais contours (contours d'objets) comme plus saillants que les zones texturées ; elle utilise de petits seuils de gradient, des opérations morphologiques et des transformations de distance pour isoler les contours.

Saillance comme Segmentation

L'estimation de la saillance peut être considérée comme une instance de segmentation d'image. La segmentation d'image est le processus de partitionnement d'une image numérique en plusieurs segments ou superpixels. L'objectif est de simplifier la représentation de l'image en quelque chose de significatif et plus facile à analyser, souvent en attribuant des étiquettes à chaque pixel. Pour la saillance, le problème de segmentation est binaire : étiqueter chaque pixel comme faisant partie du premier plan (saillant) ou de l'arrière-plan. La sortie est souvent un masque binaire où l'objet saillant est marqué en blanc et le reste en noir, ou une carte thermique continue où l'intensité indique la saillance.

Cette connexion est particulièrement importante car les techniques de segmentation et les fonctions de perte peuvent être réutilisées, et la compréhension globale des régions saillantes aide dans des tâches comme la segmentation d'image. Cependant, les cartes de saillance fournissent généralement une importance douce ou graduée plutôt que des limites dures.

Saillance Basée sur les Gradients pour l'Apprentissage Profond

Lorsqu'elles sont appliquées aux réseaux de neurones, une carte de saillance est souvent calculée en prenant le gradient du score de classe par rapport à l'entrée. Cela a été développé pour les réseaux convolutifs dans les années 2010, et les premières approches importantes utilisaient des gradients simples : pour chaque pixel, on calcule la sensibilité du score de sortie à un petit changement de ce pixel. La magnitude du gradient indique l'importance relative.

Des techniques plus sophistiquées ont suivi :

  • Gradients intégrés : Cela attribue l'importance en sommant les gradients le long d'un chemin allant d'une entrée de référence à l'entrée réelle, pour tenir compte de la saturation et garantir l'attribution si les scores de prédiction changent uniquement à des points intermédiaires.
  • Cartographie d'activation de classe (CAM) : Cela utilise les cartes de caractéristiques de la dernière couche convolutive, ses poids pour la classe cible, et produit une carte de saillance grossière, généralement à une résolution spatiale qui est suréchantillonnée.
  • Cartographie d'activation de classe pondérée par gradient (Grad-CAM) : Une extension de CAM qui utilise les gradients du score de classe par rapport aux cartes de caractéristiques pour pondérer les activations.

Ces méthodes sont spécifiques aux réseaux de neurones convolutifs (par exemple, Residual Network (ResNet)), mais elles ont été généralisées aux modèles Transformer (architecture) grâce aux mécanismes d'attention, produisant des cartes d'attention, un déploiement d'attention, ou apprenant des cartes d'attention discriminatives.

Cartes d'Attention dans les Transformeurs

Avec l'essor des architectures Transformer (architecture) dans le traitement du langage naturel et la vision, les cartes de saillance prennent la forme de poids d'attention. Dans un transformeur, le mécanisme de Multi-Head Attention calcule des scores qui indiquent à quel point un jeton de l'entrée en attend un autre. Ces poids peuvent être agrégés à travers les couches et les têtes pour produire une carte de saillance pour une entrée donnée, comme une image. Des techniques comme les déploiements d'attention et les cartes d'attention discriminatives de classe ont été développées pour rendre ces cartes plus interprétables.

Ces cartes sont souvent utilisées pour expliquer les décisions de classification pour les images, mais la même idée s'applique au texte, où elles mettent en évidence les mots ou jetons importants. Depuis les années 2020, la détection de saillance dans les transformeurs est un domaine de recherche actif, soutenant l'interprétabilité des grands modèles de langage, mais elles pourraient être moins fidèles au modèle que les cartes basées sur les gradients, car les scores d'attention ne sont pas toujours causalement responsables de la sortie.

Exemple d'Implémentation d'ALGORITHME

Bien que de nombreux algorithmes soient compliqués, une formule simple de saillance statique a été proposée. Elle calcule la distance de chaque pixel à tous les autres pixels de l'image. Pour un pixel I_k, la saillance SALS(I_k) est donnée par la somme sur tous les pixels :

SALS(I_k) = Σ_{i=1}^N |I_k - I_i|,

où I_i est la valeur du pixel dans [0,255] et N est le nombre total de pixels. Cela se développe en SALS(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|.

La formule peut être exprimée en termes d'histogramme de l'image : SALS(I_k) = Σ_n F_n × |I_k - I_n|, où F_n est la fréquence de la valeur d'intensité n (n de 0 à 255). Le calcul de l'histogramme a un temps de calcul O(N). Cela donne une représentation unique de l'importance de chaque pixel par rapport à l'image entière.

Ce type est une approche classique, maintenant souvent supplantée par les réseaux de neurones, mais elle illustre le principe fondamental.

Méthodes de Saillance par Réseaux de Neurones

En plus des méthodes basées sur les gradients et traditionnelles, les réseaux de neurones modernes sont souvent entraînés spécifiquement pour produire des cartes de saillance, souvent pour des données vidéo et multimodales. Trois exemples notables :

  • TASED-Net : Se compose d'un encodeur qui extrait des caractéristiques spatiotemporelles à basse résolution, suivi d'un réseau de prédiction qui décode les caractéristiques spatiales tout en agrégeant toutes les informations temporelles.
  • STRA-Net : Intègre des caractéristiques spatiotemporelles via un couplage visuel et de flux optique, et se concentre sur la saillance multi-échelle en utilisant un mécanisme d'attention.
  • STAViS : Combine des informations visuelles et auditives spatiotemporelles. Il utilise un réseau unique qui apprend à localiser les sources sonores puis fusionne les deux indices de saillance pour générer la carte finale.

Ces réseaux sont entraînés sur des ensembles de données vidéo pour prédire les fixations humaines au fil du temps. Ils montrent que la saillance peut être apprise à partir de données, et ils ont enrichi les méthodes au niveau de l'image avec le mouvement et l'audio.

Application dans l'IA Explicable

Dans l'intelligence artificielle explicable (XAI), les cartes de saillance sont une méthode importante pour comprendre ce qu'un modèle d'intelligence artificielle regarde. Pour un modèle effectuant une classification d'images ou une identification d'objets, la carte de saillance indique exactement quels pixels ou régions sont les plus influents pour la prédiction. Par exemple, si un réseau de neurones classe une photographie comme contenant un chien, la carte de saillance pourrait mettre en évidence la tête et la queue du chien, pas l'arrière-plan. Cela met en évidence les régions qui contribuent le plus à une décision de classe particulière.

Le choix de la méthode de saillance affecte la qualité et l'interprétabilité. Les gradients simples sont rapides mais peuvent être bruyants et produire une importance pour des régions non pertinentes, tandis que les gradients intégrés et CAM peuvent fournir une explication plus significative. Avec la sécurité et la responsabilité au niveau du système, les cartes de saillance sont utilisées pour vérifier qu'un modèle s'appuie sur des caractéristiques pertinentes, plutôt que sur des corrélations fallacieuses dues à l'arrière-plan ou à un filigrane.

Cependant, les cartes de saillance ne racontent pas toute l'histoire. Elles indiquent l'importance mais pas la logique du modèle, ni les contrefactuels. Depuis les années 2020, la recherche continue sur des explications plus robustes et fidèles.

Conclusion

Les cartes de saillance font le pont entre la compréhension de la vision humaine et le fonctionnement interne des modèles d'apprentissage profond. Elles servent à la fois de modèle biologique de l'attention et d'outil pratique pour le débogage de modèles, la compression d'images ou l'explication de décisions. Avec l'évolution des approches classiques de traitement d'images vers les méthodes de apprentissage profond et l'attention basée sur les transformeurs, la cartographie de saillance est devenue plus flexible et puissante, bien qu'elle soulève encore des questions sur ce qui constitue exactement une région "importante". Leur développement est en cours, et les cartes de saillance font partie intégrante de l'interprétabilité au niveau des pixels et des modèles neuronaux.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·explainable-ai·visual-attention·deep-learning
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique