Précision et Rappel

Traduit de l'anglais

La précision et le rappel sont des métriques de performance en classification mesurant, respectivement, la fraction des instances récupérées qui sont pertinentes et la fraction des instances pertinentes qui sont récupérées. Elles quantifient le compromis entre les faux positifs et les faux négatifs.

La précision et le rappel sont deux métriques de performance fondamentales utilisées pour évaluer la qualité d'un système de classification ou de recherche d'informations. Elles quantifient dans quelle mesure un modèle identifie les éléments pertinents d'un ensemble de données, en équilibrant les coûts des faux positifs et des faux négatifs. La précision, également appelée valeur prédictive positive, mesure la fraction des instances récupérées qui sont réellement pertinentes. Le rappel, également connu sous le nom de sensibilité, mesure la fraction de toutes les instances pertinentes qui ont été récupérées avec succès. Ensemble, elles offrent une vision plus nuancée du comportement d'un modèle que la simple exactitude, en particulier lorsque les classes sont déséquilibrées ou lorsque les coûts des différentes erreurs varient.

En termes formels, la précision est calculée comme le nombre de vrais positifs divisé par le nombre total d'éléments que le système a étiquetés comme positifs (vrais positifs plus faux positifs). Le rappel est calculé comme le nombre de vrais positifs divisé par le nombre total d'éléments qui appartiennent réellement à la classe positive (vrais positifs plus faux négatifs). Par exemple, considérons un programme informatique conçu pour reconnaître des chiens dans des photographies numériques. Si une image contient dix chats et douze chiens, et que le programme identifie huit éléments comme étant des chiens, dont cinq sont réellement des chiens (vrais positifs) et trois sont des chats (faux positifs), alors sept chiens sont manqués (faux négatifs) et sept chats sont correctement exclus (vrais négatifs). La précision du programme est de 5/8, car seulement cinq des huit éléments sélectionnés sont pertinents. Son rappel est de 5/12, car seulement cinq des douze chiens pertinents ont été trouvés.

Relation avec les erreurs statistiques

La précision et le rappel correspondent directement aux concepts des tests d'hypothèses statistiques. Si l'hypothèse nulle est qu'un élément donné n'est pas pertinent, alors un faux positif (erreur de type I) se produit lorsqu'un élément non pertinent est incorrectement sélectionné, et un faux négatif (erreur de type II) se produit lorsqu'un élément pertinent est manqué. Une précision parfaite correspond à zéro faux positif, ce qui signifie que chaque élément récupéré est pertinent. Un rappel parfait correspond à zéro faux négatif, ce qui signifie que chaque élément pertinent est récupéré. Le rappel est simplement le complément du taux d'erreur de type II, calculé comme un moins ce taux. La précision est liée au taux d'erreur de type I, mais de manière plus complexe, car elle dépend également de la distribution a priori des éléments pertinents par rapport aux éléments non pertinents dans la population. Dans l'exemple de la reconnaissance de chiens, il y a trois erreurs de type I sur dix chats au total, ce qui donne un taux d'erreur de type I de 3/10, et sept erreurs de type II sur douze chiens, ce qui donne un taux d'erreur de type II de 7/12.

Interprétation et utilité

La précision est souvent décrite comme une mesure de qualité, indiquant à quel point les prédictions positives sont fiables. Le rappel est une mesure de quantité, indiquant à quel point la couverture du système de la classe positive est complète. Une précision élevée signifie que l'algorithme renvoie principalement des résultats pertinents, tandis qu'un rappel élevé signifie qu'il renvoie la plupart des résultats pertinents, même si certains non pertinents sont également inclus. Ces métriques ne sont pas particulièrement utiles isolément. Un système peut atteindre un rappel parfait en récupérant simplement chaque élément de la collection, mais un tel système aurait une très faible précision. À l'inverse, un système peut atteindre une précision parfaite en sélectionnant un seul élément presque certainement pertinent, mais cela sacrifierait le rappel. En pratique, la précision et le rappel sont généralement rapportés ensemble, souvent via une courbe précision-rappel qui trace la précision en fonction du rappel. Typiquement, la précision diminue à mesure que le rappel augmente, reflétant le compromis inhérent entre les deux.

Le compromis précision-rappel

Il existe souvent une relation inverse entre la précision et le rappel, où l'augmentation de l'un se fait au détriment de la réduction de l'autre. L'équilibre optimal dépend de l'application spécifique et des coûts relatifs des différents types d'erreurs. Un détecteur de fumée est un exemple classique de système conçu en pensant au rappel. Il est intentionnellement sujet aux fausses alarmes (erreurs de type I) car le coût de ne pas alerter lors d'un incendie réel est prohibitif. Le détecteur sacrifie la précision pour s'assurer de détecter tous les dangers réels. En revanche, le système de justice pénale, guidé par le ratio de Blackstone selon lequel « il vaut mieux que dix coupables s'échappent plutôt qu'un innocent souffre », met l'accent sur la précision. Le système est conçu pour éviter de condamner des innocents, même si cela signifie laisser plus de coupables en liberté, sacrifiant ainsi le rappel.

Un chirurgien du cerveau retirant une tumeur cancéreuse illustre le compromis au niveau individuel. Le chirurgien doit retirer toutes les cellules tumorales pour empêcher la repousse, mais doit également éviter de retirer des cellules cérébrales saines pour préserver la fonction. Une approche plus libérale, retirant une zone plus large autour de la tumeur, augmente le rappel en s'assurant que toutes les cellules cancéreuses sont extraites, mais elle augmente également la probabilité de retirer des tissus sains. Une approche plus conservatrice augmente la précision en ciblant uniquement les cellules cancéreuses confirmées, mais elle risque de laisser certaines cellules tumorales derrière. Les deux résultats ont des conséquences significatives, et le choix du chirurgien reflète les poids relatifs accordés à la précision et au rappel dans ce contexte.

Utilisation en apprentissage automatique

En apprentissage automatique, la précision et le rappel sont des métriques d'évaluation standard pour les modèles de classification, en particulier dans les domaines avec des ensembles de données déséquilibrés. Par exemple, dans le diagnostic médical, un modèle détectant une maladie rare pourrait avoir une haute exactitude simplement en prédisant la classe majoritaire, mais la précision et le rappel révèlent son utilité réelle. Dans la recherche en intelligence artificielle, ces métriques sont utilisées pour comparer les modèles à travers des tâches telles que la détection d'objets, le filtrage du spam et la récupération de documents. Elles sont également fondamentales pour des métriques dérivées comme le score F1, qui est la moyenne harmonique de la précision et du rappel, fournissant un nombre unique qui équilibre les deux préoccupations. Les concepts s'étendent au-delà de la classification binaire à des contextes multi-classes, où la précision et le rappel sont calculés par classe puis agrégés.

Applications en recherche d'informations

La précision et le rappel sont originaires du domaine de la recherche d'informations, où ils évaluent les moteurs de recherche et les systèmes de requêtes de bases de données. Dans ce contexte, la précision mesure la proportion de documents récupérés qui sont pertinents pour la requête de l'utilisateur, tandis que le rappel mesure la proportion de tous les documents pertinents dans la collection qui ont été récupérés. Les moteurs de recherche sont souvent confrontés à un compromis : renvoyer plus de résultats peut augmenter le rappel mais peut diluer la précision avec des pages non pertinentes. Les systèmes de classement utilisent la précision à un nombre fixe de résultats, comme la précision à 10, pour évaluer la qualité des meilleurs résultats. Ces métriques restent centrales pour évaluer les systèmes de récupération modernes, y compris ceux alimentés par les grands modèles de langage et les technologies d'IA générative.

Limites et extensions

La précision et le rappel ont des limites. Ils ne tiennent pas compte des vrais négatifs, ce qui peut être important dans certaines applications. Ils sont également sensibles au choix de la classe positive, et leur interprétation dépend de la probabilité a priori de la classe positive. Lorsque la classe positive est rare, le rappel peut être difficile à améliorer sans introduire de nombreux faux positifs. Pour remédier à ces problèmes, les chercheurs ont développé des métriques connexes telles que le score F1, l'aire sous la courbe précision-rappel et le coefficient de corrélation de Matthews. En pratique, le choix de la métrique dépend des objectifs de l'application, et la précision et le rappel sont souvent rapportés aux côtés d'autres statistiques pour fournir une image complète des performances du modèle.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:classification·information-retrieval·machine-learning·evaluation-metrics
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique