Un modèle de substitution est une approximation mathématique ou computationnelle simplifiée d'un système, d'un processus ou d'un modèle plus complexe. Il est conçu pour imiter le comportement entrée-sortie du système original avec un coût de calcul significativement réduit, tout en sacrifiant une certaine fidélité. Les modèles de substitution sont largement utilisés en ingénierie de conception, en calcul scientifique et en apprentissage automatique pour permettre des tâches telles que l'optimisation, l'analyse de sensibilité et la quantification de l'incertitude, où l'évaluation répétée du système réel serait prohibitivement coûteuse. Dans le contexte de l'intelligence artificielle, les modèles de substitution servent également de substituts interprétables pour les systèmes d'apprentissage profond opaques, fournissant des explications pour des prédictions individuelles ou un comportement global.
Le concept de substitution n'est pas nouveau ; il trouve ses racines dans la méthodologie classique de surface de réponse des années 1950, où des approximations polynomiales étaient utilisées pour explorer les espaces de conception expérimentale. Cependant, le terme « modèle de substitution » a gagné en importance dans les années 1990 et 2000 au sein de la communauté d'ingénierie basée sur la simulation, en particulier pour l'optimisation aérodynamique et structurelle. Avec l'essor de l'apprentissage profond dans les années 2010, les modèles de substitution ont trouvé de nouvelles applications en tant qu'outils d'explicabilité, comblant le fossé entre les réseaux neuronaux performants mais opaques et le besoin de raisonnement compréhensible par l'humain.
Rôle dans l'apprentissage automatique et l'IA
Dans l'apprentissage automatique, les modèles de substitution servent deux rôles principaux : l'approximation et l'explication. En tant qu'approximateurs, ils peuvent remplacer des composants coûteux d'un système plus vaste. Par exemple, dans l'apprentissage par renforcement, un modèle de substitution peut approximer la dynamique de l'environnement pour permettre un entraînement plus rapide de la politique. Dans la modélisation générative, les modèles de substitution peuvent approximer la vraisemblance d'un processus génératif complexe, permettant un échantillonnage ou une notation efficace.
En tant qu'explicateurs, les modèles de substitution sont utilisés pour interpréter les modèles de boîte noire, en particulier les réseaux neuronaux profonds. La technique la plus importante dans cette catégorie est l'Explication Locale Interprétable Indépendante du Modèle (LIME), introduite par Marco Tulio Ribeiro, Sameer Singh et Carlos Guestrin en 2016. LIME construit un modèle de substitution linéaire local autour d'une prédiction spécifique en perturbant l'entrée et en observant la sortie de la boîte noire. Le substitut est ensuite utilisé pour expliquer quelles caractéristiques ont le plus influencé cette prédiction. Une autre approche courante est SHapley Additive exPlanations (SHAP), qui utilise les valeurs de Shapley issues de la théorie des jeux pour attribuer des scores d'importance, souvent calculés via un modèle de substitution.
Les explications globales par substitution, telles que les arbres de décision ou les listes de règles, peuvent approximer la frontière de décision entière d'un réseau neuronal. Elles sont utilisées pour distiller des modèles complexes en formes interprétables, une pratique connue sous le nom de distillation de modèle ou d'extraction de connaissances. Par exemple, un arbre de décision de substitution pourrait être entraîné sur les sorties d'un grand modèle de langage pour approximer sa logique de classification pour une tâche spécifique.
Types de modèles de substitution
Les modèles de substitution se présentent sous plusieurs formes, chacune avec des forces et des faiblesses distinctes. Les surfaces de réponse polynomiales, y compris les modèles linéaires et quadratiques, sont simples et rapides mais peinent avec un comportement fortement non linéaire. Les modèles de processus gaussiens, également connus sous le nom de krigeage, fournissent une prédiction probabiliste avec des estimations d'incertitude, ce qui les rend populaires pour l'optimisation bayésienne. Les réseaux de fonctions de base radiale utilisent des fonctions de base localisées pour interpoler les points de données, offrant une flexibilité dans des dimensions modérées.
La régression par vecteurs de support et les modèles de substitution par réseaux neuronaux peuvent capturer des non-linéarités complexes mais nécessitent plus de données et de réglage. Ces dernières années, les substituts d'apprentissage profond, tels que ceux basés sur des architectures convolutionnelles ou de transformeurs, ont été utilisés pour approximer des simulations physiques de haute dimension. Par exemple, un réseau neuronal convolutionnel peut agir comme un substitut pour un solveur de dynamique des fluides computationnelle, prédisant des champs d'écoulement en quelques millisecondes au lieu de plusieurs heures.
Les méthodes d'ensemble, telles que les forêts aléatoires ou le boosting de gradient, sont également utilisées comme substituts, offrant une robustesse et gérant des types d'entrée mixtes. Le choix du modèle de substitution dépend de la dimensionnalité de l'espace d'entrée, de la quantité de données d'entraînement disponibles, de la précision requise et du besoin de quantification de l'incertitude.
Applications en ingénierie et en science
Dans la conception technique, les modèles de substitution permettent l'optimisation de simulations coûteuses. Par exemple, en ingénierie aérospatiale, la forme aérodynamique d'une aile est optimisée à l'aide de simulations de dynamique des fluides computationnelle (CFD) qui peuvent prendre des heures par évaluation. Un modèle de substitution entraîné sur un ensemble de résultats CFD permet à l'optimiseur d'explorer des milliers de candidats de conception en quelques secondes, les meilleurs candidats étant ensuite vérifiés à l'aide de la simulation complète.
En mécanique des structures, les modèles de substitution approximent les résultats d'analyse par éléments finis pour évaluer la contrainte, la déformation et le risque de défaillance sous des charges variables. En science de l'environnement, les substituts modélisent le climat ou l'écoulement des eaux souterraines pour soutenir les décisions politiques. Dans la découverte de médicaments, les modèles de substitution prédisent des propriétés moléculaires, telles que l'affinité de liaison, pour cribler de grandes bibliothèques chimiques avant des expériences de laboratoire humide coûteuses.
En ingénierie nucléaire, les modèles de substitution sont utilisés pour la conception de réacteurs et l'analyse de sûreté, où les simulations complètes sont intensives en calcul. Le Centre de recherche atomique Bhabha a employé la modélisation par substitution pour les calculs de physique des réacteurs. De même, en science des matériaux, les substituts prédisent les propriétés des matériaux à partir de la composition et des paramètres de traitement, accélérant la découverte de nouveaux alliages ou polymères.
Modèles de substitution en optimisation
L'optimisation bayésienne est un cadre important qui repose sur des modèles de substitution, généralement des processus gaussiens. Le substitut fournit une distribution a posteriori sur la fonction objectif, et une fonction d'acquisition équilibre l'exploration (échantillonnage de régions incertaines) et l'exploitation (échantillonnage de régions prometteuses). Cette approche est largement utilisée pour le réglage des hyperparamètres des modèles d'apprentissage automatique, où chaque évaluation implique l'entraînement d'un modèle complet. Par exemple, le réglage du taux d'apprentissage ou de la taille de lot d'un réseau neuronal profond peut être effectué avec l'optimisation bayésienne utilisant un substitut, réduisant le nombre d'exécutions d'entraînement requises de centaines à des dizaines.
L'optimisation basée sur des substituts est également utilisée dans la conception des réseaux neuronaux eux-mêmes, y compris la recherche d'architecture. Ici, un substitut prédit la performance d'une architecture candidate sans l'entraîner complètement, permettant une exploration efficace de l'espace d'architecture. Cette technique a été appliquée dans les plateformes d'apprentissage automatique automatisé (AutoML).
Interprétabilité et explicabilité
L'une des utilisations les plus impactantes des modèles de substitution en IA est l'explicabilité. Alors que les modèles d'apprentissage profond deviennent de plus en plus complexes, avec des milliards de paramètres dans les grands modèles de langage, comprendre leurs décisions devient critique pour la confiance et la sécurité. Les modèles de substitution offrent une solution pragmatique en approximant le comportement local ou global sous une forme lisible par l'humain.
Les substituts locaux, comme LIME, sont indépendants du modèle et peuvent être appliqués à tout classifieur ou régresseur. Ils fonctionnent en échantillonnant des perturbations autour d'une instance spécifique, en les pondérant par proximité, et en ajustant un modèle simple tel qu'une régression linéaire ou un arbre de décision. Les coefficients ou la structure de l'arbre révèlent ensuite quelles caractéristiques ont conduit la prédiction. Cela est particulièrement utile dans des domaines à enjeux élevés comme la santé, la finance et la justice pénale.
Les substituts globaux, tels que les arbres de décision ou les ensembles de règles, visent à approximer le modèle entier. Cependant, ils échouent souvent à capturer la complexité complète d'un réseau profond, conduisant à des explications inexactes. Les chercheurs ont développé des techniques comme la « distillation » pour entraîner un modèle plus simple sur les sorties du modèle original, mais cela peut encore entraîner une perte de fidélité. En 2025, il existe une recherche active sur l'utilisation de l'IA générative pour produire des explications en langage naturel, mais celles-ci ne sont pas strictement des modèles de substitution au sens traditionnel.
Limites et défis
Les modèles de substitution ont des limitations inhérentes. Le défi principal est le compromis entre fidélité et interprétabilité. Un substitut très précis peut être aussi opaque que le modèle original, ce qui va à l'encontre de l'objectif d'explication. Inversement, un substitut simple peut être trop inexact pour être digne de confiance.
Un autre défi est la malédiction de la dimensionnalité. À mesure que l'espace d'entrée grandit, le nombre d'échantillons nécessaires pour entraîner un substitut précis augmente de manière exponentielle. Cela est particulièrement problématique pour des problèmes de haute dimension comme la classification d'images ou de texte, où un substitut local doit opérer dans un espace de milliers de dimensions.
Les modèles de substitution supposent également que la fonction sous-jacente est lisse et continue, ce qui peut ne pas tenir pour tous les systèmes. Des discontinuités ou des changements brusques peuvent faire échouer les substituts. De plus, les substituts ne sont aussi bons que les données sur lesquelles ils sont entraînés ; si les données d'entraînement sont biaisées ou non représentatives, le substitut propagera ces biais.
Dans le contexte de l'explicabilité, il existe un risque de « blanchiment d'explication » - utiliser un substitut pour fournir une explication plausible mais inexacte. Cela peut conduire à une confiance erronée dans la décision d'un modèle. Des chercheurs comme Melanie Mitchell et Aleksander Madry ont souligné ces préoccupations, mettant l'accent sur le besoin de validation rigoureuse des explications basées sur des substituts.
Orientations futures
Les développements futurs des modèles de substitution devraient se concentrer sur l'amélioration de la fidélité et de l'évolutivité. Des techniques telles que l'apprentissage actif, où le substitut sélectionne les points de données à interroger auprès du modèle original, peuvent réduire les coûts d'entraînement. Les substituts multi-fidélité combinent des données de basse et haute fidélité pour atteindre une meilleure précision avec des évaluations coûteuses limitées.
Dans l'apprentissage profond, il y a un intérêt croissant pour l'utilisation de réseaux neuronaux comme substituts pour les simulations physiques, souvent appelés « opérateurs neuronaux ». Ces modèles, tels que les opérateurs neuronaux de Fourier, peuvent apprendre des correspondances entre des espaces de fonctions et généraliser à travers différentes résolutions. Cela pourrait révolutionner des domaines comme la prévision météorologique et la modélisation climatique.
Pour l'explicabilité, il y a une poussée vers des substituts plus fidèles qui peuvent garantir un certain niveau de fidélité. Des méthodes comme les « ancres » fournissent des règles si-alors qui sont localement fidèles. De plus, il y a des recherches sur l'utilisation de modèles de substitution pour expliquer non seulement des prédictions individuelles mais aussi le comportement de modèles entiers, comme l'identification des points de données d'entraînement qui influencent le plus les sorties d'un modèle.
Alors que les systèmes d'IA deviennent plus intégrés dans la prise de décision critique, la demande pour des modèles de substitution fiables va croître. Des organisations comme OpenAI et Google DeepMind investissent dans la recherche sur l'interprétabilité, et les modèles de substitution sont un outil clé dans cet effort. Le défi réside dans l'équilibre entre simplicité et précision, en s'assurant que les substituts servent de guides dignes de confiance plutôt que de raccourcis trompeurs.
Conclusion
Les modèles de substitution sont un outil polyvalent et essentiel à la fois en ingénierie et en intelligence artificielle. Ils fournissent un moyen pratique d'approximer des systèmes complexes, permettant l'optimisation, l'analyse et l'explication. Bien qu'ils aient des limitations, en particulier dans des contextes de haute dimension et discontinus, la recherche en cours continue d'étendre leurs capacités. En 2025, les modèles de substitution restent une pierre angulaire de l'interprétabilité des modèles et du calcul efficace, comblant le fossé entre la puissance des modèles complexes et le besoin de compréhension humaine.