Les techniques d'interprétabilité sont un composant central de l'IA explicable (XAI), un domaine de recherche qui cherche à fournir aux humains une supervision intellectuelle sur les algorithmes d'intelligence artificielle. Ces techniques se concentrent sur le raisonnement derrière les décisions ou les prédictions faites par les modèles d'IA, les rendant plus compréhensibles et transparentes. Cela répond au besoin des utilisateurs d'examiner la prise de décision automatisée dans les applications, en particulier là où la sécurité et la confiance sont cruciales. Les techniques d'interprétabilité contrecarrent la tendance « boîte noire » de l'apprentissage automatique, où même les concepteurs d'une IA ne peuvent pas expliquer pourquoi elle a pris une décision spécifique.
L'objectif principal des techniques d'interprétabilité est d'aider les utilisateurs des systèmes alimentés par l'IA à performer plus efficacement en améliorant leur compréhension de la façon dont ces systèmes raisonnent. Elles peuvent également servir de mise en œuvre du droit social à l'explication, et même en l'absence d'exigences légales, elles peuvent améliorer l'expérience utilisateur en renforçant la confiance. Ces techniques visent à expliquer ce qui a été fait, ce qui est fait, ce qui sera fait ensuite, et sur quelles informations ces actions sont basées, permettant aux utilisateurs de confirmer et de contester les connaissances existantes et de générer de nouvelles hypothèses.
Contexte : Modèles boîte blanche et boîte noire
Les algorithmes d'apprentissage automatique utilisés en IA peuvent être catégorisés comme boîte blanche ou boîte noire. Les modèles boîte blanche fournissent des résultats compréhensibles pour les experts du domaine, tandis que les modèles boîte noire sont extrêmement difficiles à expliquer et peuvent ne pas être compris même par les experts. Les techniques d'interprétabilité suivent trois principes : transparence, interprétabilité et explicabilité.
Un modèle est transparent si les processus qui extraient les paramètres du modèle à partir des données d'entraînement et génèrent des étiquettes à partir des données de test peuvent être décrits et motivés par le concepteur de l'approche. L'interprétabilité décrit la possibilité de comprendre le modèle et de présenter la base sous-jacente de la prise de décision d'une manière compréhensible pour les humains. L'explicabilité, bien que reconnue comme importante, manque d'une définition consensuelle ; une possibilité est « la collection de caractéristiques du domaine interprétable qui ont contribué, pour un exemple donné, à produire une décision ».
En résumé, l'interprétabilité fait référence à la capacité de l'utilisateur à comprendre les sorties du modèle, tandis que la transparence du modèle inclut la simulabilité (reproductibilité des prédictions), la décomposabilité (explications intuitives pour les paramètres) et la transparence algorithmique (expliquer comment les algorithmes fonctionnent). La fonctionnalité du modèle se concentre sur les descriptions textuelles, la visualisation et les explications locales, qui clarifient des sorties ou des instances spécifiques plutôt que des modèles entiers. Tous ces concepts visent à améliorer la compréhensibilité et l'utilisabilité des systèmes d'IA.
Méthodes d'attribution de caractéristiques
Les méthodes d'attribution de caractéristiques sont parmi les techniques d'interprétabilité les plus utilisées. Elles attribuent des scores d'importance aux caractéristiques d'entrée, indiquant combien chaque caractéristique a contribué à la prédiction d'un modèle. Par exemple, dans un modèle d'analyse de sentiment, une méthode d'attribution de caractéristiques pourrait mettre en évidence le mot « horrible » comme un indicateur négatif fort. Ces méthodes sont particulièrement utiles pour les réseaux de neurones et d'autres modèles complexes où la logique interne est opaque.
Les techniques courantes d'attribution de caractéristiques incluent les méthodes basées sur le gradient comme les cartes de saillance, qui calculent le gradient de la sortie par rapport à l'entrée, et les méthodes basées sur la perturbation qui observent comment les prédictions changent lorsque les entrées sont modifiées. Ces techniques sont souvent appliquées dans la reconnaissance d'images pour identifier quels pixels sont les plus influents, ou dans le traitement du langage naturel pour mettre en évidence les mots clés d'un texte.
Techniques de saillance et de visualisation
Les techniques de saillance sont un sous-ensemble de l'attribution de caractéristiques qui se concentrent sur la visualisation des parties d'une entrée les plus pertinentes pour la décision d'un modèle. En vision par ordinateur, les cartes de saillance superposent des cartes de chaleur sur les images pour montrer les régions sur lesquelles le modèle s'est concentré. Par exemple, un modèle entraîné à reconnaître des chevaux pourrait produire une carte de saillance qui met en évidence le corps et les jambes du cheval, plutôt que des éléments d'arrière-plan.
Les techniques de visualisation s'étendent également à la compréhension des représentations internes des modèles de apprentissage profond. Par exemple, les chercheurs peuvent visualiser les filtres appris par les couches convolutionnelles d'un réseau résiduel pour voir quels motifs ils détectent, comme des bords ou des textures. Ces méthodes aident les experts à vérifier que le modèle apprend des caractéristiques significatives plutôt que des corrélations fallacieuses.
Explications locales et globales
Les techniques d'interprétabilité peuvent être catégorisées par leur portée : les explications locales clarifient des prédictions individuelles, tandis que les explications globales décrivent le comportement global d'un modèle. Les méthodes d'explication locale, comme LIME (Local Interpretable Model-agnostic Explanations), approximent un modèle complexe avec un modèle plus simple et interprétable autour d'une instance spécifique. Cela aide les utilisateurs à comprendre pourquoi une décision particulière a été prise, comme pourquoi une demande de prêt a été rejetée.
Les explications globales visent à fournir un aperçu de la logique du modèle, souvent par le biais de modèles de substitution ou d'extraction de règles. Par exemple, des arbres de décision peuvent être entraînés pour imiter un modèle boîte noire, offrant une représentation lisible par les humains de ses frontières de décision. Ces méthodes globales sont précieuses pour auditer les modèles en matière d'équité ou de biais, car elles révèlent des schémas généraux qui pourraient autrement passer inaperçus.
Modèles à goulot d'étranglement conceptuel
Les modèles à goulot d'étranglement conceptuel sont un type spécifique d'architecture interprétable qui utilise des abstractions au niveau conceptuel pour expliquer le raisonnement du modèle. Ces modèles prédisent d'abord des concepts compréhensibles par les humains à partir de l'entrée, puis utilisent ces concepts pour prendre la décision finale. Par exemple, dans une tâche d'imagerie médicale, un modèle pourrait d'abord prédire la présence de lésions spécifiques, puis utiliser ces prédictions pour diagnostiquer une maladie. Cette approche peut être appliquée à des tâches de prédiction d'images et de texte.
Les modèles à goulot d'étranglement conceptuel sont particulièrement importants dans des domaines comme la médecine, la défense, la finance et le droit, où il est crucial de comprendre les décisions et de renforcer la confiance dans les algorithmes. En rendant le raisonnement intermédiaire explicite, ces modèles permettent aux humains de vérifier que le modèle utilise des critères sensés, plutôt que de s'appuyer sur des corrélations opaques.
Régression symbolique et approches boîte blanche
De nombreux chercheurs soutiennent que, au moins pour l'apprentissage automatique supervisé, la voie à suivre est la régression symbolique, où l'algorithme recherche l'espace des expressions mathématiques pour trouver le modèle qui correspond le mieux à un ensemble de données donné. Cette approche produit des formules explicites qui peuvent être inspectées et comprises par les humains, offrant un haut degré de transparence. La régression symbolique est souvent utilisée dans la découverte scientifique, où l'objectif est de découvrir des lois physiques sous-jacentes.
Les algorithmes boîte blanche, qui ont une structure interprétable, peuvent parfois atteindre une haute précision. Par exemple, les arbres de décision et les modèles linéaires sont intrinsèquement interprétables, et avec une ingénierie de caractéristiques soignée, ils peuvent être compétitifs avec des modèles plus complexes. Ces approches sont préférées dans les industries réglementées où l'explicabilité est une exigence.
Défis et limites
Malgré leurs avantages, les techniques d'interprétabilité font face à plusieurs défis. Un problème majeur est le compromis entre précision et interprétabilité ; les modèles complexes comme les grands modèles de langage atteignent souvent des performances plus élevées mais sont plus difficiles à expliquer. De plus, certaines techniques ne fournissent que des explications approximatives, qui peuvent ne pas capturer toute la complexité du raisonnement du modèle.
Un autre défi est le potentiel d'explications trompeuses. Par exemple, une carte de saillance pourrait mettre en évidence des caractéristiques non pertinentes en raison de bruit ou de perturbations adverses. En outre, les techniques d'interprétabilité elles-mêmes peuvent être manipulées, car les modèles pourraient être optimisés pour produire des explications plausibles mais incorrectes. Les chercheurs continuent de travailler sur le développement de méthodes plus robustes et fiables.
Applications et orientations futures
Les techniques d'interprétabilité sont appliquées dans divers domaines, y compris la santé, la finance et les systèmes autonomes. En médecine, les systèmes d'aide à la décision clinique (CDSS) s'appuient sur ces techniques pour aider les professionnels de santé à comprendre et à faire confiance aux décisions basées sur les machines. En finance, elles sont utilisées pour assurer la conformité aux réglementations et pour détecter les biais dans les prêts ou la notation de crédit.
Le programme XAI de la DARPA, initié par l'Agence des projets de recherche avancée de la défense des États-Unis, vise à produire des modèles « boîte de verre » explicables pour un « humain dans la boucle » sans sacrifier grandement la performance de l'IA. Ce programme a stimulé des avancées significatives dans le domaine. Les orientations futures incluent le développement de techniques d'interprétabilité pour les modèles basés sur transformers, l'amélioration de la fidélité des explications, et l'intégration de l'interprétabilité dans le processus d'entraînement lui-même, plutôt que comme une analyse post-hoc.