Les ancres sont une technique d’apprentissage automatique interprétable qui génère des explications locales de haute précision pour des prédictions individuelles faites par n’importe quel modèle de type « boîte noire ». Contrairement aux explications globales qui décrivent un modèle entier, les ancres se concentrent sur une instance unique, produisant une règle simple de type « si... alors » – par exemple « si âge > 30 et revenu > 50 000 $, alors la prédiction est approuvée » – conçue pour être valable avec une probabilité élevée autour de cette instance. Cette méthode a été introduite par Marco Tulio Ribeiro, Sameer Singh et Carlos Guestrin en 2018, en s’appuyant sur leurs travaux antérieurs sur les explications locales interprétables indépendantes du modèle (LIME). Les ancres sont particulièrement appréciées pour leur précision et leur facilité de compréhension humaine, ce qui en fait un outil pratique pour auditer et déboguer les systèmes de Machine learning dans des domaines à enjeux élevés comme la finance et la santé.
L’idée centrale des ancres est de fournir une règle qui « ancre » la prédiction : si les conditions de la règle sont remplies, la prédiction est censée rester la même, quelles que soient les variations des autres caractéristiques. Cela contraste avec LIME, qui ajuste un modèle linéaire local et peut être instable. Les ancres utilisent une recherche basée sur l’apprentissage par renforcement pour trouver des règles qui maximisent la couverture (la proportion d’instances dans le voisinage où la règle s’applique) tout en maintenant un seuil de précision spécifié par l’utilisateur, généralement de 0,95 ou plus. Le résultat est une règle transparente et lisible par l’humain, offrant une garantie de fidélité locale, sous réserve de bornes statistiques.
Définition formelle et précision
Formellement, une ancre est une règle A qui consiste en une conjonction de prédicats sur les caractéristiques (par exemple, « caractéristique1 = valeur1 et caractéristique2 > valeur2 »). Pour une instance donnée x et un modèle de type « boîte noire » f, l’ancre A est dite expliquer f(x) si la règle s’applique à x et si la précision de A est au moins un seuil τ. La précision est définie comme la probabilité que f(x') = f(x) pour toutes les instances x' qui satisfont A, où la probabilité est prise sur une distribution de perturbations qui approxime le voisinage local. En pratique, cette probabilité est estimée par échantillonnage, et l’algorithme utilise une approche de bandit manchot à plusieurs bras pour explorer efficacement les règles candidates.
La couverture est une autre métrique clé, définie comme la probabilité qu’une instance perturbée aléatoirement dans le voisinage satisfasse A. L’objectif est de trouver une règle avec une précision élevée (garantissant la fiabilité) et une couverture aussi élevée que possible (garantissant que la règle n’est pas trop étroite). L’algorithme équilibre ces deux objectifs, produisant souvent des règles plus concises que celles d’autres méthodes d’explication locale.
Algorithme et implémentation
Ribeiro et ses collègues ont implémenté les ancres à l’aide d’un cadre d’apprentissage par renforcement, où l’état est l’ensemble actuel de prédicats et les actions ajoutent de nouveaux prédicats pour affiner la règle. La récompense est une combinaison de précision et de couverture, avec une pénalité pour les règles trop complexes. La recherche est guidée par une politique qui apprend quels prédicats sont susceptibles de produire des règles de haute précision, en utilisant une variante de l’algorithme de borne de confiance supérieure (UCB) pour l’exploration. Cela rend la méthode efficace sur le plan computationnel même pour des données de grande dimension, bien qu’elle puisse encore être plus lente que des méthodes plus simples comme LIME.
L’implémentation open source, disponible dans le paquet Python anchor, prend en charge à la fois les données tabulaires et textuelles. Pour le texte, les ancres peuvent générer des règles basées sur la présence ou l’absence de mots, comme « si l’avis contient “pas bien”, alors le sentiment est négatif ». Le paquet s’intègre avec les modèles scikit-learn et peut gérer des caractéristiques catégorielles et continues, ces dernières étant discrétisées en intervalles lors de la génération des règles.
Comparaison avec LIME et SHAP
Les ancres ont été développées en réponse aux limites de LIME, qui ajuste un modèle linéaire local et peut être sensible au choix du noyau de perturbation. Les explications de LIME sont souvent instables, ce qui signifie que de petits changements dans l’entrée peuvent entraîner des explications radicalement différentes. Les ancres remédient à cela en fournissant une règle explicitement conçue pour être robuste dans un voisinage défini. Cependant, les ancres sont moins flexibles que LIME pour capturer un comportement local non linéaire, car elles ne fournissent que des règles binaires plutôt qu’une importance pondérée des caractéristiques.
Comparées à SHAP (explications additives de Shapley), qui fournit une attribution des contributions basée sur la théorie des jeux, les ancres offrent un compromis différent. Les valeurs SHAP sont additives et peuvent être sommées pour obtenir la prédiction, mais elles ne fournissent pas de règle de décision directe. Les ancres sont plus actionnables pour les utilisateurs finaux qui ont besoin de savoir « dans quelles conditions cette prédiction tient-elle ? », mais elles manquent de la cohérence globale de SHAP. En pratique, les praticiens utilisent souvent les ancres en complément de méthodes globales pour obtenir une image complète.
Applications dans les domaines à enjeux élevés
Les ancres ont été appliquées dans divers domaines où la transparence des modèles est critique. En finance, elles aident à expliquer les décisions de notation de crédit, permettant aux agents de prêt de comprendre pourquoi une demande a été rejetée et de le communiquer aux clients. En santé, les ancres peuvent clarifier pourquoi un modèle prédit un risque élevé de réadmission, aidant ainsi les cliniciens dans leur prise de décision. Par exemple, une règle pourrait indiquer « si le patient a un diabète et un âge > 65 ans, alors le risque prédit est élevé ». De telles règles sont plus faciles à valider avec les connaissances du domaine que des poids de caractéristiques bruts.
La méthode a également été utilisée en traitement du langage naturel pour expliquer les classificateurs de sentiments et les détecteurs de spam. Par exemple, une ancre pour un e-mail de spam pourrait être « si l’e-mail contient “gratuit” et “cliquez ici”, alors il s’agit de spam ». Cela aide les développeurs à identifier les corrélations fallacieuses et à améliorer la robustesse des modèles.
Limites et critiques
Malgré ses forces, les ancres présentent plusieurs limites. La garantie de précision est statistique et dépend de la distribution de perturbation, qui peut ne pas refléter parfaitement les changements de distribution réels. Si le voisinage est défini trop étroitement, la règle peut ne pas se généraliser ; s’il est trop large, la précision peut chuter. L’algorithme de recherche peut également produire des règles trop complexes, bien que la fonction de récompense pénalise cela. De plus, les ancres ne conviennent pas aux espaces de grande dimension avec de nombreuses caractéristiques en interaction, car l’espace des règles croît de manière exponentielle.
Les critiques ont noté que les ancres, comme d’autres méthodes locales, peuvent être contournées par des perturbations adverses. Un attaquant pourrait concevoir des entrées qui satisfont la règle mais conduisent à des prédictions différentes en dehors du voisinage échantillonné. Cela a motivé des recherches sur des méthodes d’explication plus robustes, mais les ancres restent une référence pour la comparaison.
Extensions et variantes
Plusieurs extensions ont été proposées pour améliorer les ancres. Une variante, appelée « ancres avec optimisation de la couverture », se concentre sur la maximisation de la couverture tout en maintenant la précision, en utilisant une recherche gloutonne. Une autre extension adapte les ancres à la classification multi-classes, générant des règles pour chaque classe. Il existe également des travaux sur l’utilisation des ancres pour les explications contrefactuelles, où la règle est modifiée pour montrer ce qui changerait la prédiction. Ces développements ont maintenu les ancres pertinentes dans le domaine en évolution rapide de l’IA interprétable.
Dans le contexte des Large language models modernes, les ancres ont été adaptées pour expliquer les prédictions de modèles basés sur des Transformer (architecture)s, bien que les espaces de plongement de grande dimension posent des défis. Les chercheurs ont combiné les ancres avec des méthodes basées sur l’attention pour fournir des explications plus conviviales, mais cela reste un domaine de recherche actif.
Relation avec d’autres méthodes d’interprétabilité
Les ancres appartiennent à la famille plus large des méthodes d’explication locales et indépendantes du modèle, qui comprend également LIME, SHAP et les explications contrefactuelles. Elles se distinguent des méthodes globales comme l’importance des caractéristiques ou les graphiques de dépendance partielle. Dans la taxonomie de l’interprétabilité, les ancres sont considérées comme des explications « basées sur des règles », similaires aux arbres de décision mais générées localement. Cela les rend particulièrement utiles pour les utilisateurs non experts qui comprennent facilement la logique « si... alors ».
Le développement des ancres a influencé les travaux ultérieurs dans le domaine, notamment la création de métriques d’évaluation plus rigoureuses pour les explications. Des chercheurs d’institutions comme le MIT CSAIL et le Stanford AI Lab ont cité les ancres comme référence pour de nouvelles méthodes. La méthode est également enseignée dans des cours sur l’apprentissage automatique interprétable, aux côtés de LIME et SHAP.
Utilisation pratique et outils
Pour utiliser les ancres, un praticien charge généralement un modèle entraîné et un ensemble de données, puis appelle l’expliqueur d’ancres avec l’instance d’intérêt. L’algorithme nécessite de spécifier le seuil de précision et le nombre d’échantillons pour l’estimation. La sortie est une règle avec des estimations de précision et de couverture associées. Le paquet anchor fournit également des outils de visualisation pour afficher les règles dans un format lisible. Il est compatible avec Python 3 et peut être installé via pip.
Dans les environnements de production, les ancres peuvent être intégrées dans des pipelines de surveillance pour signaler lorsque le comportement d’un modèle change. Par exemple, si la précision d’une règle diminue au fil du temps, cela peut indiquer une dérive des données. Cela s’aligne avec l’accent croissant sur les opérations de machine learning (MLOps) et la gouvernance des modèles.
Orientations futures
Le domaine de l’IA explicable évolue, et les ancres sont susceptibles d’être dépassées par des méthodes plus sophistiquées qui combinent des perspectives locales et globales. Cependant, le principe central des règles de haute précision reste précieux. Avec la montée des modèles Generative AI, il existe un besoin de méthodes d’explication capables de gérer des données non structurées, et les ancres pourraient être étendues pour fonctionner avec les plongements de Neural networks. Les chercheurs explorent également comment rendre les ancres plus robustes aux changements de distribution, un défi clé pour le déploiement dans le monde réel.
En résumé, les ancres offrent un moyen pratique et compréhensible par l’humain d’expliquer des prédictions individuelles, comblant un créneau entre les approximations linéaires simples et les modèles globaux complexes. Leur accent sur la précision en fait un choix fiable pour les applications critiques, et leurs innovations algorithmiques ont inspiré une génération d’outils d’interprétabilité.