Traduit de l'anglais

Les ancres sont une technique d'explication locale basée sur des règles en apprentissage automatique qui identifie des conditions suffisantes pour la prédiction d'un modèle, fournissant des règles si-alors lisibles par l'humain pour expliquer des décisions individuelles.

Les ancres sont une technique en Machine learning pour générer des explications locales des prédictions de modèles. Elles ont été introduites en 2018 par des chercheurs de l’Université de Washington, dirigés par Marco Tulio Ribeiro, comme successeur de la méthode antérieure LIME (Local Interpretable Model-agnostic Explanations). Les ancres fournissent des explications sous forme de conditions simples, basées sur des règles, qui sont suffisantes pour qu’une prédiction particulière soit maintenue, indépendamment des changements d’autres caractéristiques. Contrairement à LIME, qui approxime un modèle localement avec un modèle linéaire, les ancres visent à créer des règles précises et à haute fiabilité qui délimitent clairement quand une prédiction est garantie ou très probable.

L’idée centrale derrière les ancres est de répondre à la question : « Quel ensemble minimal de valeurs de caractéristiques, s’il est présent, suffit-il pour que le modèle produise le même résultat ? » Par exemple, dans un classificateur de spam, une ancre pourrait être « si l’e-mail contient le mot "loterie" et que l’expéditeur n’est pas dans la liste de contacts, alors la prédiction est spam », avec une précision déclarée de 0,95. Cette règle est considérée comme une ancre car elle « ancre » la prédiction : tant que les conditions sont remplies, la prédiction reste stable même si d’autres caractéristiques varient. La technique est indépendante du modèle, ce qui signifie qu’elle peut être appliquée à tout modèle boîte noire, y compris les Neural networks, les systèmes de Deep learning et les Large language models, sans nécessiter l’accès aux paramètres internes.

Définition formelle et précision

Formellement, une ancre est une règle qui consiste en un ensemble de paires caractéristique-valeur. Étant donné une instance x à expliquer, une ancre A est un ensemble de prédicats qui s’appliquent à x. La règle est dite une ancre si elle satisfait deux propriétés : la couverture et la précision. La couverture fait référence à la proportion d’instances dans le voisinage local qui satisfont la règle, tandis que la précision est la probabilité que la prédiction du modèle pour les instances satisfaisant la règle corresponde à la prédiction pour x. L’objectif est de trouver une règle avec une précision élevée (généralement au-dessus d’un seuil défini par l’utilisateur, comme 0,95) et une couverture aussi élevée que possible, pour garantir que l’explication soit à la fois précise et largement applicable.

Pour estimer la précision sans énumérer toutes les perturbations possibles, les ancres utilisent un algorithme de bandit manchot à plusieurs bras. L’algorithme échantillonne des perturbations de l’instance originale, où les instances perturbées sont générées en remplaçant les valeurs des caractéristiques par des valeurs provenant d’une distribution (souvent basée sur les données d’entraînement ou un ensemble de données de fond). L’approche par bandit explore efficacement l’espace des règles possibles, en se concentrant sur celles qui sont susceptibles d’avoir une haute précision. L’ancre finale est la règle qui maximise la couverture sous la contrainte de précision, avec des garanties statistiques basées sur le nombre d’échantillons.

Comparaison avec LIME

Les ancres ont été développées en réponse aux limitations de LIME, qui a également été introduit par Ribeiro et ses collègues en 2016. LIME explique les prédictions en ajustant un modèle linéaire parcimonieux dans le voisinage de l’instance, mais le modèle linéaire peut être trompeur pour des frontières de décision fortement non linéaires. Par exemple, une approximation linéaire pourrait suggérer qu’une caractéristique a un effet positif ou négatif, mais en réalité, l’effet pourrait être conditionnel à d’autres caractéristiques. Les ancres évitent cela en fournissant des règles explicites de type si-alors qui sont suffisantes, les rendant plus intuitives pour les utilisateurs humains. De plus, les explications de LIME ne sont pas garanties d’être fidèles au comportement du modèle, tandis que les ancres fournissent une mesure de précision qui quantifie la fidélité.

Une autre différence clé est que LIME génère des explications locales qui peuvent varier avec le noyau de perturbation, tandis que les ancres visent à être plus stables et interprétables. Les ancres sont également conçues pour être plus actionnables : une règle comme « si la caractéristique A et la caractéristique B, alors la prédiction C » peut être directement utilisée pour comprendre et potentiellement intervenir dans le système.

Algorithme et implémentation

L’algorithme d’ancres fonctionne en deux phases principales : la génération de candidats et la validation. Dans la première phase, il génère des règles candidates en considérant des combinaisons de valeurs de caractéristiques de l’instance. Pour les caractéristiques continues, il les discrétise en intervalles (par exemple, en utilisant des quantiles) pour créer des prédicats. L’algorithme utilise une recherche par faisceau pour explorer l’espace des règles, en commençant par les valeurs de caractéristiques les plus fréquentes et en s’étendant. Dans la phase de validation, chaque règle candidate est testée en échantillonnant des perturbations et en calculant la précision empirique. L’algorithme de bandit (spécifiquement, l’algorithme KL-LUCB) est utilisé pour allouer les échantillons efficacement, en s’arrêtant lorsque l’estimation de précision est suffisamment fiable.

L’implémentation, disponible dans la bibliothèque open-source anchor (partie de la bibliothèque interpret de Microsoft), prend en charge les données tabulaires, le texte et les images. Pour le texte, les ancres peuvent être basées sur la présence ou l’absence de mots (par exemple, « si la phrase "pas mal" apparaît, alors le sentiment est positif »). Pour les images, les ancres utilisent des super-pixels (segments de l’image) comme caractéristiques, et la règle pourrait être « si ces pixels sont présents, alors l’image est classée comme un chien ». La bibliothèque fournit également des outils de visualisation pour afficher les ancres dans un format lisible par l’humain.

Applications pratiques

Les ancres ont été appliquées dans divers domaines où l’interprétabilité des modèles est critique. Dans le secteur de la santé, les ancres peuvent expliquer pourquoi un modèle prédit qu’un patient a une certaine maladie, en se basant sur des caractéristiques comme l’âge, la pression artérielle et les résultats de laboratoire. Par exemple, une ancre pourrait être « si l’âge > 60 et la pression artérielle systolique > 140, alors risque élevé de maladie cardiaque ». Cela aide les cliniciens à faire confiance et à valider les décisions du modèle. Dans la finance, les ancres peuvent expliquer les décisions d’approbation de crédit, garantissant la conformité avec les réglementations qui exigent des explications pour les actions défavorables. Dans la détection de fraude, les ancres peuvent mettre en évidence la combinaison de caractéristiques de transaction qui déclenche une alerte de fraude.

Dans le contexte de la Generative AI et des Large language models, les ancres ont été utilisées pour expliquer pourquoi un modèle génère une réponse particulière. Par exemple, une ancre pour un classificateur de sentiment pourrait être « si le texte contient "amour" et "incroyable", alors le sentiment est positif ». Cependant, pour les LLM, l’espace des caractéristiques est plus complexe, et les ancres reposent souvent sur des caractéristiques au niveau des jetons. Les chercheurs ont également exploré l’utilisation des ancres pour déboguer les modèles, en identifiant les corrélations fallacieuses qui conduisent à des prédictions incorrectes.

Limitations et défis

Malgré leurs avantages, les ancres présentent plusieurs limitations. Premièrement, elles ne sont aussi bonnes que la distribution de perturbation utilisée pour générer des instances contrefactuelles. Si la distribution ne reflète pas des variations réalistes, les estimations de précision peuvent être trompeuses. Deuxièmement, les ancres peuvent être coûteuses en calcul, surtout pour des données à haute dimension, car l’espace de recherche croît de manière exponentielle. Troisièmement, pour les caractéristiques continues, la discrétisation peut conduire à des règles trop grossières ou trop fines, affectant l’interprétabilité. Quatrièmement, les ancres fournissent des conditions suffisantes mais non nécessaires, donc elles peuvent ne pas expliquer pleinement pourquoi une prédiction a été faite ; il peut y avoir plusieurs ancres pour la même prédiction, et l’algorithme n’en trouve qu’une.

Un autre défi est que les ancres supposent une indépendance des caractéristiques dans le processus de perturbation, ce qui peut ne pas tenir dans les données réelles. Par exemple, dans le texte, la présence de certains mots est souvent corrélée, mais la perturbation peut les traiter indépendamment, conduisant à des échantillons irréalistes. Les chercheurs ont proposé des extensions pour gérer les dépendances, mais celles-ci ne sont pas encore standard.

Extensions et travaux connexes

Depuis l’introduction des ancres, plusieurs extensions ont été proposées. Une extension notable est l’utilisation de règles de décision pour des explications globales, comme dans la bibliothèque SkopeRules, qui extrait des règles d’ensembles d’arbres. Une autre est l’intégration des ancres avec des explications contrefactuelles, où l’objectif est de trouver des changements minimaux pour inverser la prédiction. Les ancres sont également liées au concept de « raisons suffisantes » en explicabilité formelle, qui vise à calculer des sous-ensembles minimaux de caractéristiques qui garantissent une prédiction. Dans cette ligne de travail, des algorithmes ont été développés pour calculer des ancres exactes pour des modèles comme les arbres de décision et les réseaux de neurones, en utilisant des techniques de vérification formelle.

Dans le domaine plus large de l’IA explicable (XAI), les ancres côtoient d’autres méthodes d’explication locale comme SHAP (SHapley Additive exPlanations), qui fournit des attributions de caractéristiques basées sur la théorie des jeux. Alors que SHAP donne une vue globale de l’importance des caractéristiques, les ancres fournissent une explication plus directe basée sur des règles. Certaines études ont comparé les deux, constatant que les ancres sont souvent plus intuitives pour les non-experts, tandis que SHAP est plus complet.

Impact et orientations futures

L’introduction des ancres a influencé le développement d’outils d’interprétabilité dans l’industrie. Les principaux fournisseurs de cloud, y compris Amazon Web Services, Microsoft Azure et Google Cloud, ont intégré des méthodes d’explication basées sur des règles dans leurs plateformes d’apprentissage automatique, permettant aux utilisateurs de générer des ancres pour les modèles déployés sur leur infrastructure. Par exemple, AWS SageMaker Clarify inclut une fonctionnalité pour générer des explications similaires aux ancres, et Azure Machine Learning offre des composants d’interprétabilité qui incluent des explications basées sur des règles.

Les orientations futures de la recherche incluent l’amélioration de l’évolutivité des ancres pour les données à haute dimension, le développement de méthodes pour gérer les dépendances entre caractéristiques, et l’intégration des ancres avec des outils interactifs permettant aux utilisateurs d’explorer des règles alternatives. De plus, à mesure que les modèles de Deep learning deviennent plus complexes, il y a un besoin croissant d’explications qui soient à la fois fidèles et compréhensibles, et les ancres sont bien positionnées pour répondre à ce besoin, en particulier lorsqu’elles sont combinées avec d’autres techniques comme le Model Pruning et la Data Augmentation pour améliorer la simplicité des modèles.

En résumé, les ancres représentent une avancée significative dans l’interprétabilité locale, offrant un équilibre entre fidélité et compréhension humaine. En fournissant des conditions suffisantes pour les prédictions, elles permettent aux parties prenantes de comprendre et de faire confiance aux systèmes d’IA, ce qui est essentiel pour un déploiement responsable dans des domaines à enjeux élevés.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:explainable-ai·machine-learning·interpretability·local-explanations
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique