Traduit de l'anglais

Les cartes de saillance sont des cartes thermiques qui mettent en évidence les régions les plus importantes d'une image pour l'attention visuelle humaine ou les prédictions de modèles d'apprentissage automatique, utilisées en vision par ordinateur et en IA explicable.

En vision par ordinateur, une carte de saillance est une image qui met en évidence soit la région sur laquelle les yeux des personnes se concentrent en premier, soit les régions les plus pertinentes pour les modèles d'apprentissage automatique. L'objectif d'une carte de saillance est de refléter le degré d'importance d'un pixel pour le système visuel humain ou pour un modèle d'apprentissage automatique autrement opaque. Par exemple, dans une image d'un paysage, une personne pourrait d'abord regarder un fort et des nuages légers, de sorte que ces régions seraient mises en évidence sur la carte de saillance. Les cartes de saillance sont largement utilisées dans des applications allant de la compression d'images à l'intelligence artificielle explicable, où elles fournissent des explications visuelles des décisions des modèles.

Le concept de saillance provient des études sur l'attention visuelle humaine. Le cortex visuel primaire (V1) semble être responsable de la carte de saillance, selon l'hypothèse de saillance V1. En apprentissage automatique, les cartes de saillance sont généralement générées pour les réseaux neuronaux profonds, en particulier les réseaux de neurones convolutifs et les transformeurs, afin d'indiquer quelles parties de l'entrée influencent le plus la sortie.

Applications pour l'œil humain

Les cartes de saillance ont des applications dans une variété de problèmes différents. Pour l'attention de l'œil humain, elles sont utilisées dans :

  • Compression d'images et de vidéos : L'œil humain se concentre uniquement sur une petite région d'intérêt dans le cadre. Par conséquent, il n'est pas nécessaire de compresser tout le cadre avec une qualité uniforme. L'utilisation d'une carte de saillance réduit la taille finale de la vidéo avec la même perception visuelle.
  • Évaluation de la qualité d'images et de vidéos : La tâche principale d'une métrique de qualité d'image ou de vidéo est une corrélation élevée avec les opinions des utilisateurs. Les différences dans les régions saillantes reçoivent plus d'importance et contribuent ainsi davantage au score de qualité.
  • Redimensionnement d'images : Cela vise à redimensionner une image en agrandissant ou en rétrécissant les régions non informatives. Les algorithmes de redimensionnement reposent sur la disponibilité de cartes de saillance qui estiment avec précision tous les détails saillants de l'image.
  • Détection et reconnaissance d'objets : Au lieu d'appliquer un algorithme complexe sur le plan computationnel à toute l'image, on peut l'appliquer aux régions les plus saillantes d'une image les plus susceptibles de contenir un objet.

Intelligence artificielle explicable

Les cartes de saillance sont un outil important dans l'intelligence artificielle explicable, fournissant des explications visuelles du processus de décision des modèles d'apprentissage automatique, en particulier des réseaux neuronaux profonds. Ces cartes mettent en évidence les régions des données d'entrée qui influencent le plus la sortie du modèle, indiquant efficacement où le modèle "regarde" lorsqu'il fait une prédiction. Dans les tâches de classification d'images, par exemple, les cartes de saillance peuvent identifier les pixels ou les régions qui contribuent le plus à une décision de classe spécifique.

Développées pour les réseaux de neurones convolutifs, les techniques de cartographie de saillance vont de la simple prise du gradient du score de classe par rapport aux données d'entrée à des algorithmes plus complexes, tels que les gradients intégrés et la cartographie d'activation de classe. Dans l'architecture de transformeur, les mécanismes d'attention ont conduit à des cartes de saillance analogues, telles que les cartes d'attention, les déploiements d'attention et les cartes d'attention discriminatives de classe.

Saillance comme problème de segmentation

L'estimation de la saillance peut être considérée comme une instance de segmentation d'image. En vision par ordinateur, la segmentation d'image est le processus de partitionnement d'une image numérique en plusieurs segments (ensembles de pixels, également appelés superpixels). L'objectif de la segmentation est de simplifier et/ou de changer la représentation d'une image en quelque chose de plus significatif et plus facile à analyser. La segmentation d'image est généralement utilisée pour localiser des objets et des limites (lignes, courbes, etc.) dans les images. Plus précisément, la segmentation d'image est le processus d'attribution d'une étiquette à chaque pixel d'une image de sorte que les pixels avec la même étiquette partagent certaines caractéristiques.

Algorithmes classiques

Il existe trois formes d'algorithmes classiques d'estimation de saillance implémentés dans OpenCV :

  • Saillance statique : Repose sur les caractéristiques et les statistiques de l'image pour localiser les régions d'intérêt d'une image.
  • Saillance de mouvement : Repose sur le mouvement dans une vidéo, détecté par flux optique. Les objets qui se déplacent sont considérés comme saillants.
  • Objectness : L'objectness reflète la probabilité qu'une fenêtre d'image couvre un objet. Ces algorithmes génèrent un ensemble de boîtes englobantes de l'endroit où un objet peut se trouver dans une image.

En plus des approches classiques, les méthodes basées sur les réseaux neuronaux sont également populaires. Il existe des exemples de réseaux neuronaux pour l'estimation de saillance de mouvement :

  • TASED-Net : Se compose de deux blocs de construction. D'abord, le réseau encodeur extrait des caractéristiques spatio-temporelles à basse résolution, puis le réseau de prédiction suivant décode les caractéristiques spatialement encodées tout en agrégeant toutes les informations temporelles.
  • STRA-Net : Met l'accent sur deux problèmes essentiels. D'abord, les caractéristiques spatio-temporelles intégrées via le couplage d'apparence et de flux optique, puis la saillance multi-échelle apprise via le mécanisme d'attention.
  • STAViS : Combine des informations visuelles et auditives spatio-temporelles. Cette approche utilise un seul réseau qui apprend à localiser les sources sonores et à fusionner les deux saillances pour obtenir une carte de saillance finale.

Il existe une méthode de saillance statique plus récente appelée sensibilité à la distorsion visuelle. Elle est basée sur l'idée que les véritables bords, c'est-à-dire les contours d'objets, sont plus saillants que d'autres régions texturées complexes. Elle détecte les bords d'une manière différente des algorithmes classiques de détection de bords. Elle utilise un seuil assez petit pour les magnitudes de gradient afin de considérer la simple présence des gradients. Elle obtient quatre cartes binaires pour les directions verticale, horizontale et deux diagonales. Une fermeture et une ouverture morphologiques sont appliquées aux images binaires pour fermer les petits espaces. Pour éliminer les formes ressemblant à des blobs, elle utilise la transformée de distance. Après tout, les groupes de pixels connectés sont des bords individuels (ou contours). Un seuil de taille de l'ensemble de pixels connectés est utilisé pour déterminer si un bloc d'image contient un bord perceptible (région saillante) ou non.

Exemple d'implémentation

Une carte de saillance simple peut être calculée en calculant la distance de chaque pixel au reste des pixels dans le même cadre. La valeur de saillance pour un pixel \(I_k\) est donnée par :

\(\mathrm{SALS}(I_k) = \sum_{i=1}^{N} |I_k - I_i|\)

où \(I_i\) est la valeur du pixel \(i\), dans la plage de [0,255]. La forme développée est :

\(\mathrm{SALS}(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|\)

où N est le nombre total de pixels dans le cadre actuel. La formule peut être restructurée en regroupant les pixels avec la même valeur d'intensité :

\(\mathrm{SALS}(I_k) = \sum_{n=0}^{255} F_n \times |I_k - I_n|\)

où \(F_n\) est la fréquence de la valeur d'intensité \(I_n\). Les fréquences sont exprimées sous forme d'histogramme, et le temps de calcul de l'histogramme est \(O(N)\). Cette approche est efficace et constitue la base de nombreuses méthodes classiques de détection de saillance.

Approches par réseaux neuronaux

La génération moderne de cartes de saillance repose souvent sur l'apprentissage profond. Pour les réseaux de neurones convolutifs, les méthodes basées sur le gradient calculent la dérivée du score de classe par rapport à l'image d'entrée, produisant une carte de saillance qui met en évidence les pixels avec l'influence la plus forte. Les gradients intégrés et la cartographie d'activation de classe (CAM) sont des techniques plus avancées qui fournissent des cartes plus lisses et plus discriminatives. Dans les transformeurs, les mécanismes d'attention produisent des cartes d'attention qui peuvent être agrégées à travers les couches, connues sous le nom de déploiements d'attention, pour créer des cartes de saillance pour les entrées visuelles et textuelles. Ces méthodes sont largement utilisées dans apprentissage automatique et apprentissage profond pour l'interprétabilité des modèles.

Applications dans d'autres domaines

Bien que les cartes de saillance soient plus courantes en vision par ordinateur, elles ont été adaptées à d'autres domaines. En traitement du langage naturel, les cartes de saillance peuvent mettre en évidence les mots ou les jetons qui influencent le plus la prédiction d'un modèle, en particulier dans les modèles basés sur transformeur comme grands modèles de langage. En traitement audio, les cartes de saillance peuvent indiquer les régions temps-fréquence pertinentes pour la classification. Le principe sous-jacent reste le même : identifier les parties de l'entrée qui comptent le plus pour la sortie.

Défis et limites

Les cartes de saillance ne sont pas sans critiques. Elles peuvent être sensibles à de petites perturbations dans l'entrée, conduisant à des explications instables. Certaines méthodes produisent des cartes qui ne sont pas discriminatives de classe, ce qui signifie qu'elles mettent en évidence des régions généralement saillantes plutôt que spécifiques à une prédiction particulière. De plus, évaluer la qualité des cartes de saillance est difficile, car il n'y a pas de vérité terrain pour l'attention du modèle. Les chercheurs continuent de développer de nouvelles techniques pour améliorer la fiabilité et l'interprétabilité, s'appuyant souvent sur des idées issues de la recherche sur réseaux neuronaux et de l'éthique de intelligence artificielle.

Directions futures

Alors que les modèles de intelligence artificielle deviennent plus complexes, le besoin d'explications transparentes augmente. Les cartes de saillance sont susceptibles de rester un outil clé dans l'IA explicable, en particulier pour les applications à enjeux élevés comme l'imagerie médicale et la conduite autonome. Les avancées dans IA générative et les modèles multimodaux peuvent conduire à de nouvelles formes de saillance qui combinent des indices visuels, textuels et auditifs. La recherche dans des institutions comme MIT CSAIL, Stanford AI Lab et Berkeley AI Research continue de repousser les limites de l'interprétabilité, avec les cartes de saillance servant de technique fondamentale.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·explainable-ai·saliency·interpretability
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique