Explicabilité des modèles

Traduit de l'anglais

L'explicabilité des modèles, ou intelligence artificielle explicable (XAI), est le degré auquel les décisions internes d'un système d'IA peuvent être comprises par les humains, visant à rendre les modèles d'apprentissage automatique transparents et interprétables plutôt qu'opaques, comme des « boîtes noires ».

L'explicabilité des modèles, également connue sous le nom d'intelligence artificielle explicable (XAI) ou d'apprentissage automatique interprétable, est le degré auquel les décisions internes d'un système d'IA peuvent être comprises par les humains. C'est un domaine de recherche qui explore des méthodes pour fournir aux humains une supervision intellectuelle sur les algorithmes d'IA, en se concentrant sur le raisonnement derrière les décisions ou les prédictions afin de les rendre plus compréhensibles et transparentes. Cela répond au besoin pour les utilisateurs d'examiner la prise de décision automatisée dans les applications, en contrant la tendance « boîte noire » de l'apprentissage automatique où même les concepteurs peuvent ne pas expliquer pourquoi une décision spécifique a été prise.

La XAI cherche à aider les utilisateurs de systèmes alimentés par l'IA à performer plus efficacement en améliorant leur compréhension de la manière dont ces systèmes raisonnent. Elle peut être une mise en œuvre du droit social à l'explication, et même sans exigences légales, elle peut améliorer l'expérience utilisateur en aidant les utilisateurs finaux à avoir confiance que l'IA prend de bonnes décisions. La XAI vise à expliquer ce qui a été fait, ce qui est fait, ce qui sera fait ensuite, et sur quelles informations ces actions sont basées, permettant de confirmer et de contester les connaissances existantes.

Contexte

Les algorithmes d'apprentissage automatique (ML) utilisés dans l'IA peuvent être catégorisés comme boîte blanche ou boîte noire. Les modèles en boîte blanche fournissent des résultats compréhensibles pour les experts du domaine, tandis que les modèles en boîte noire sont extrêmement difficiles à expliquer et peuvent ne pas être compris même par les experts. Les algorithmes XAI suivent trois principes : la transparence, l'interprétabilité et l'explicabilité.

La transparence signifie que les processus qui extraient les paramètres du modèle à partir des données d'entraînement et génèrent des étiquettes à partir des données de test peuvent être décrits et motivés par le concepteur de l'approche. L'interprétabilité décrit la possibilité de comprendre le modèle ML et de présenter la base sous-jacente de la prise de décision d'une manière compréhensible pour les humains. L'explicabilité, bien que reconnue comme importante, manque d'une définition consensuelle ; une possibilité est « la collection de caractéristiques du domaine interprétable qui ont contribué, pour un exemple donné, à produire une décision ».

En résumé, l'interprétabilité fait référence à la capacité de l'utilisateur à comprendre les sorties du modèle, tandis que la transparence du modèle inclut la simulabilité (reproductibilité des prédictions), la décomposabilité (explications intuitives pour les paramètres) et la transparence algorithmique (expliquer comment les algorithmes fonctionnent). La fonctionnalité du modèle se concentre sur les descriptions textuelles, la visualisation et les explications locales qui clarifient des sorties spécifiques plutôt que des modèles entiers. Ces concepts visent à améliorer la compréhensibilité et l'utilisabilité des systèmes d'IA.

Si les algorithmes remplissent ces principes, ils fournissent une base pour justifier les décisions, les suivre, les vérifier, améliorer les algorithmes et explorer de nouveaux faits. Parfois, des résultats de haute précision sont réalisables avec des algorithmes ML en boîte blanche, qui ont des structures interprétables. Les modèles à goulot d'étranglement conceptuel, utilisant des abstractions au niveau des concepts, en sont des exemples et peuvent être appliqués dans des tâches de prédiction d'images et de texte. Cela est particulièrement important dans des domaines comme la médecine, la défense, la finance et le droit, où comprendre les décisions et établir la confiance est crucial. De nombreux chercheurs soutiennent que pour l'apprentissage automatique supervisé, la régression symbolique - où l'algorithme recherche des expressions mathématiques pour trouver le modèle le mieux adapté - est une voie prometteuse.

Les systèmes d'IA optimisent le comportement pour satisfaire des objectifs mathématiquement spécifiés choisis par les concepteurs, comme « maximiser la précision de l'évaluation de la positivité des critiques de films dans l'ensemble de données de test ». L'IA peut apprendre des règles utiles comme « les critiques contenant "horrible" sont probablement négatives », mais aussi des règles inappropriées comme « les critiques contenant "Daniel Day-Lewis" sont généralement positives », qui peuvent échouer à généraliser ou être considérées comme injustes. Un humain peut auditer les règles dans une XAI pour évaluer la probabilité que le système généralise aux futures données du monde réel.

Objectifs

La coopération entre les agents - algorithmes et humains - dépend de la confiance. Si les humains doivent accepter les prescriptions algorithmiques, ils doivent leur faire confiance. L'incomplétude des critères de confiance formels est un obstacle à l'optimisation. La transparence, l'interprétabilité et l'explicabilité sont des objectifs intermédiaires vers des critères de confiance plus complets. Cela est particulièrement pertinent en médecine, surtout avec les systèmes d'aide à la décision clinique (CDSS), où les professionnels de la santé doivent comprendre comment et pourquoi une décision basée sur une machine a été prise pour faire confiance et augmenter leur prise de décision.

Les systèmes d'IA apprennent parfois des astuces indésirables qui satisfont des objectifs préprogrammés explicites sur les données d'entraînement mais pas les désirs implicites nuancés des concepteurs ou la complexité complète des données du domaine. Par exemple, un système de 2017 chargé de la reconnaissance d'images a appris à « tricher » en cherchant une étiquette de droit d'auteur associée aux images de chevaux plutôt que d'apprendre à déterminer si un cheval était représenté. Un autre système de 2017, une IA d'apprentissage supervisé chargée de saisir des objets dans un monde virtuel, a appris à tricher en plaçant son manipulateur entre l'objet et le spectateur pour sembler faussement le saisir.

Un projet de transparence, le programme DARPA XAI, vise à produire des modèles « boîte de verre » qui sont explicables à un « humain dans la boucle » sans sacrifier considérablement la performance de l'IA. Les utilisateurs humains peuvent comprendre la cognition de l'IA (en temps réel et après coup) et déterminer s'ils doivent lui faire confiance. D'autres applications incluent l'extraction de connaissances à partir de modèles en boîte noire et les comparaisons de modèles. Dans les systèmes de surveillance pour la conformité éthique et socio-légale, les outils « boîte de verre » suivent les entrées et sorties, fournissant des explications basées sur les valeurs pour garantir que le système fonctionne conformément aux normes éthiques et légales. Le terme contraste avec les systèmes « boîte noire », qui manquent de transparence et sont plus difficiles à surveiller et à réguler.

Techniques

Les techniques d'explicabilité peuvent être spécifiques au modèle ou agnostiques au modèle. Les méthodes spécifiques au modèle sont adaptées à des algorithmes particuliers, tels que les architectures de réseaux neuronaux, tandis que les méthodes agnostiques au modèle fonctionnent avec n'importe quel modèle en analysant les entrées et sorties.

Les explications locales interprétables agnostiques au modèle (LIME) approximent un modèle en boîte noire localement avec un modèle de substitution interprétable pour expliquer des prédictions individuelles. SHAP (SHapley Additive exPlanations) utilise les valeurs de Shapley de la théorie des jeux pour attribuer des scores d'importance aux caractéristiques pour chaque prédiction. Ces méthodes sont largement utilisées pour les données tabulaires, les images et le texte.

Pour les modèles de apprentissage profond, les cartes de saillance mettent en évidence les régions d'entrée qui influencent le plus les prédictions, souvent utilisées en vision par ordinateur. La maximisation d'activation génère des entrées qui maximisent les activations des neurones pour visualiser quelles caractéristiques un modèle détecte. Pour les grands modèles de langage, les poids d'attention dans les architectures transformers peuvent indiquer sur quels jetons le modèle se concentre, bien que leur interprétabilité soit débattue.

Les explications basées sur des concepts, telles que les modèles à goulot d'étranglement conceptuel, utilisent des concepts compréhensibles par les humains comme représentations intermédiaires. Ces modèles prédisent d'abord des concepts (par exemple, « a des ailes ») puis les utilisent pour prendre des décisions finales, rendant le raisonnement transparent.

Défis

Un défi majeur est le compromis entre précision et explicabilité. Les modèles complexes comme les réseaux neuronaux profonds atteignent souvent une précision plus élevée mais sont moins interprétables, tandis que les modèles en boîte blanche plus simples peuvent être moins précis. Cependant, certains soutiennent qu'une haute précision peut être atteinte avec des modèles interprétables, et la régression symbolique est une solution potentielle pour l'apprentissage supervisé.

Un autre défi est le manque de définition consensuelle de l'explicabilité, rendant l'évaluation difficile. Différentes parties prenantes peuvent exiger différents types d'explications, et ce qui est interprétable pour un utilisateur peut ne pas l'être pour un autre.

De plus, les explications peuvent être trompeuses ou incomplètes. Par exemple, les cartes de saillance peuvent ne pas refléter fidèlement le raisonnement du modèle, et les poids d'attention peuvent ne pas représenter l'importance causale. Garantir que les explications sont fidèles au comportement réel du modèle est un domaine de recherche en cours.

Applications

L'explicabilité est critique dans les domaines à enjeux élevés. En médecine, les systèmes d'aide à la décision clinique nécessitent des explications pour les diagnostics et les recommandations de traitement afin d'établir la confiance parmi les cliniciens. En finance, les modèles de notation de crédit et de détection de fraude doivent être explicables pour la conformité réglementaire et la compréhension des clients. En droit, la recherche juridique assistée par IA et les recommandations de sentence nécessitent de la transparence pour garantir l'équité et la responsabilité.

Dans les véhicules autonomes, tels que ceux développés par Waymo et Tesla Autopilot, l'explicabilité aide les ingénieurs à déboguer les systèmes et les régulateurs à évaluer la sécurité. Dans les systèmes de IA générative, comprendre pourquoi un modèle produit certaines sorties est important pour détecter les biais et garantir une utilisation responsable.

Orientations futures

La recherche continue d'améliorer les méthodes d'explicabilité, y compris le développement de métriques d'évaluation plus robustes et la création d'explications à la fois fidèles et conviviales. Il y a un intérêt croissant pour les explications causales qui vont au-delà des corrélations pour identifier les relations de cause à effet. Alors que les systèmes d'IA deviennent plus intégrés dans la société, l'explicabilité des modèles deviendra probablement une exigence standard, potentiellement mandatée par les réglementations.

La collaboration entre le monde académique et l'industrie, comme les efforts à MIT CSAIL, Stanford AI Lab et Berkeley AI Research, fait progresser le domaine. Des entreprises comme OpenAI, Anthropic et Google DeepMind investissent dans la recherche sur l'interprétabilité pour leurs modèles. L'objectif ultime est de créer des systèmes d'IA qui sont non seulement puissants mais aussi transparents et dignes de confiance.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·machine-learning·interpretability·explainable-ai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique