Estimation de l'incertitude

Traduit de l'anglais

L'estimation de l'incertitude quantifie la confiance des modèles d'apprentissage automatique, distinguant l'incertitude aléatoire (inhérente aux données) et l'incertitude épistémique (liée aux connaissances du modèle), souvent à l'aide de méthodes bayésiennes.

L'estimation de l'incertitude en apprentissage automatique désigne le processus de quantification de la confiance des prédictions d'un modèle. Elle distingue l'incertitude aléatoire, qui provient du caractère aléatoire inhérent aux données, et l'incertitude épistémique, qui découle d'un manque de connaissance du modèle. Cette distinction est cruciale pour les applications où les décisions reposent sur les sorties du modèle, comme le diagnostic médical, la conduite autonome et la prévision financière. En estimant l'incertitude, les systèmes peuvent signaler les prédictions à faible confiance, déclencher une revue humaine ou ajuster leur comportement en conséquence.

Ce concept s'inspire du domaine plus large de la quantification de l'incertitude (UQ), utilisé depuis longtemps en science computationnelle et en ingénierie. L'UQ vise à caractériser les incertitudes dans les modèles computationnels et les expériences du monde réel, souvent à l'aide de méthodes statistiques et probabilistes. En apprentissage automatique, l'estimation de l'incertitude a gagné en importance avec l'essor de l'apprentissage profond, où les modèles sont souvent trop confiants et mal calibrés. Les techniques vont des réseaux neuronaux bayésiens aux méthodes d'ensemble et aux procédures de calibration.

Sources d'incertitude

L'incertitude dans les modèles d'apprentissage automatique peut provenir de multiples sources, parallèlement à celles de l'UQ traditionnelle. L'incertitude des paramètres survient lorsque les paramètres du modèle ne sont pas exactement connus, comme les poids d'un réseau neuronal estimés à partir de données limitées. L'incertitude paramétrique provient de la variabilité des variables d'entrée, comme le bruit des capteurs dans les tâches de perception. L'incertitude structurelle, également appelée inadéquation du modèle, se produit lorsque l'architecture ou les hypothèses du modèle ne capturent pas parfaitement la fonction sous-jacente réelle. L'incertitude algorithmique découle d'approximations numériques lors de l'entraînement ou de l'inférence, comme la descente de gradient stochastique ou l'arithmétique en précision finie. L'incertitude expérimentale reflète le bruit dans les étiquettes des données d'entraînement, et l'incertitude d'interpolation survient lorsque des prédictions sont faites pour des entrées éloignées de la distribution d'entraînement.

Incertitude aléatoire vs. épistémique

La taxonomie la plus courante en apprentissage automatique divise l'incertitude en deux catégories. L'incertitude aléatoire, du latin 'alea' (dé), est le caractère aléatoire irréductible inhérent aux données. Par exemple, en classification d'images, deux images identiques peuvent avoir des étiquettes différentes en raison d'erreurs d'étiquetage ou de contenu ambigu. Cette incertitude ne peut pas être réduite en collectant plus de données. L'incertitude épistémique, du grec 'episteme' (connaissance), est une incertitude réductible due à un manque de connaissance sur le modèle ou les données. Elle peut être diminuée en rassemblant plus de données d'entraînement, en améliorant l'architecture du modèle ou en utilisant de meilleures méthodes d'inférence. En pratique, les deux types coexistent souvent, et les séparer est un objectif clé de l'estimation de l'incertitude.

Méthodes bayésiennes

L'inférence bayésienne fournit un cadre théorique pour l'estimation de l'incertitude épistémique. Dans les réseaux neuronaux bayésiens, au lieu d'apprendre un ensemble unique de poids, une distribution a posteriori sur les poids est calculée à partir des données d'entraînement. Cette distribution capture l'incertitude des paramètres, et les prédictions sont faites en intégrant sur cette distribution. Cependant, l'inférence bayésienne exacte est intraitable pour les réseaux profonds modernes, donc des approximations sont utilisées. L'inférence variationnelle approxime la distribution a posteriori avec une distribution plus simple, tandis que les méthodes de Monte Carlo par chaîne de Markov (MCMC) échantillonnent à partir de la distribution a posteriori. Le dropout, une technique de régularisation courante, peut être interprété comme une approximation bayésienne, comme l'a montré Yarin Gal en 2016, permettant d'obtenir des estimations d'incertitude à partir de modèles existants sans modifications architecturales.

Méthodes d'ensemble

Les méthodes d'ensemble offrent une alternative pratique à l'inférence bayésienne explicite. En entraînant plusieurs modèles avec des initialisations ou des sous-ensembles de données différents, la variance entre leurs prédictions fournit une estimation de l'incertitude épistémique. Les ensembles profonds, introduits par Balaji Lakshminarayanan et al. en 2017, ont montré qu'ils produisent des estimations d'incertitude bien calibrées et surpassent les modèles uniques. La dispersion des prédictions des membres de l'ensemble indique l'incertitude, tandis que la prédiction moyenne sert de sortie finale. Les ensembles sont largement utilisés en pratique en raison de leur simplicité et de leur efficacité, bien qu'ils nécessitent un coût computationnel supplémentaire.

Calibration et évaluation

Les estimations d'incertitude ne sont utiles que si elles sont bien calibrées, ce qui signifie qu'une probabilité prédite de 0,8 devrait être correcte 80 % du temps. La calibration est généralement mesurée à l'aide de diagrammes de fiabilité et de métriques comme l'erreur de calibration attendue (ECE). Les réseaux neuronaux modernes sont souvent mal calibrés, surtout lorsqu'ils sont entraînés avec des techniques comme la perte d'entropie croisée et la normalisation par lots. La mise à l'échelle de température, une méthode de calibration a posteriori, ajuste la température de softmax pour améliorer la calibration sans changer la précision. D'autres méthodes incluent la mise à l'échelle de Platt et la régression isotonique. L'évaluation de l'estimation de l'incertitude implique également des métriques comme le score de Brier, la log-vraisemblance négative et la couverture des intervalles de confiance.

Applications en apprentissage profond

L'estimation de l'incertitude est cruciale dans les applications critiques pour la sécurité. En conduite autonome, des systèmes comme Waymo et Tesla Autopilot utilisent l'incertitude pour décider quand se fier aux données des capteurs ou demander une intervention humaine. En imagerie médicale, l'incertitude aide les radiologues à prioriser les cas à examiner. En traitement du langage naturel, les grands modèles de langage comme ceux de OpenAI et Anthropic peuvent exprimer l'incertitude dans leurs réponses, bien que la calibration reste un défi. L'incertitude joue également un rôle dans l'apprentissage actif, où les modèles sélectionnent les échantillons les plus incertains pour l'étiquetage, et dans l'apprentissage par renforcement, où elle guide l'exploration.

Défis et orientations futures

Malgré les progrès, l'estimation de l'incertitude en apprentissage profond fait face à plusieurs défis. L'évolutivité est un problème majeur, car les méthodes bayésiennes et les ensembles sont coûteux en calcul. Les exemples adverses peuvent tromper les estimations d'incertitude, les rendant trop confiantes. Le décalage distributionnel, où les données de test diffèrent des données d'entraînement, est particulièrement difficile à détecter. La recherche explore des approches hybrides, comme la combinaison d'ensembles avec des approximations bayésiennes, et l'utilisation de l'incertitude dans la sélection de modèles et la prise de décision. Alors que les modèles sont déployés dans des domaines plus critiques, une estimation robuste de l'incertitude deviendra de plus en plus importante.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:uncertainty-estimation·machine-learning·bayesian-methods·calibration
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique