Précision et rappel

Traduit de l'anglais

La précision et le rappel sont des métriques de classification mesurant respectivement la fraction d'instances pertinentes parmi celles récupérées et la fraction d'instances pertinentes récupérées, utilisées notamment pour les tâches déséquilibrées.

La précision et le rappel sont deux métriques de performance fondamentales utilisées en classification et en recherche d'informations pour évaluer la qualité des prédictions d'un modèle. La précision, également appelée valeur prédictive positive, mesure la fraction d'instances pertinentes parmi toutes les instances récupérées. Le rappel, également connu sous le nom de sensibilité, mesure la fraction d'instances pertinentes qui ont été récupérées avec succès. Ces deux métriques reposent sur le concept de pertinence, qui est généralement défini par la tâche spécifique, comme l'identification d'une classe particulière dans un ensemble de données.

Dans une tâche de classification, la précision pour une classe donnée est le nombre de vrais positifs (éléments correctement étiquetés comme appartenant à la classe) divisé par le nombre total d'éléments étiquetés comme appartenant à cette classe, soit la somme des vrais positifs et des faux positifs. Le rappel est le nombre de vrais positifs divisé par le nombre total d'éléments qui appartiennent réellement à la classe, soit la somme des vrais positifs et des faux négatifs. Ces définitions correspondent aux formules générales : la précision égale les instances pertinentes récupérées divisées par toutes les instances récupérées, et le rappel égale les instances pertinentes récupérées divisées par toutes les instances pertinentes.

Considérons un programme informatique conçu pour reconnaître des chiens dans des photographies numériques. Si une image contient dix chats et douze chiens, et que le programme identifie huit éléments comme étant des chiens, dont cinq sont en réalité des chiens (vrais positifs) et trois sont des chats (faux positifs), alors sept chiens sont manqués (faux négatifs) et sept chats sont correctement exclus (vrais négatifs). La précision du programme est de 5/8, car seulement cinq des huit éléments sélectionnés sont pertinents. Son rappel est de 5/12, car seulement cinq des douze chiens pertinents sont récupérés. Cet exemple illustre comment la précision et le rappel capturent différents aspects de la performance.

Relation avec les tests d'hypothèses

La précision et le rappel peuvent être compris à travers le prisme des tests d'hypothèses. Dans une configuration typique, l'hypothèse nulle est qu'un élément donné est non pertinent (par exemple, pas un chien). Une erreur de type I se produit lorsqu'un élément pertinent est incorrectement rejeté, ce qui correspond à un faux positif. Une erreur de type II se produit lorsqu'un élément non pertinent est incorrectement accepté, ce qui correspond à un faux négatif. Une précision parfaite (aucun faux positif) équivaut à l'absence d'erreurs de type I, tandis qu'un rappel parfait (aucun faux négatif) équivaut à l'absence d'erreurs de type II.

Plus généralement, le rappel est le complément du taux d'erreur de type II, ce qui signifie que le rappel égale un moins le taux de faux négatifs. La précision est liée au taux d'erreur de type I, mais de manière plus complexe, car elle dépend également de la distribution a priori des éléments pertinents par rapport aux éléments non pertinents dans la population. Dans l'exemple des chiens, il y a trois erreurs de type I (faux positifs) sur dix chats au total, ce qui donne un taux d'erreur de type I de 3/10. Il y a sept erreurs de type II (faux négatifs) sur douze chiens, ce qui donne un taux d'erreur de type II de 7/12.

La précision comme qualité, le rappel comme quantité

La précision est souvent considérée comme une mesure de qualité, indiquant combien des éléments récupérés sont réellement pertinents. Une précision élevée signifie qu'un algorithme retourne plus de résultats pertinents que de résultats non pertinents. Le rappel, en revanche, est une mesure de quantité, indiquant combien des éléments pertinents sont récupérés. Un rappel élevé signifie qu'un algorithme retourne la plupart des résultats pertinents, que des résultats non pertinents soient également retournés ou non.

Ces métriques ne sont pas particulièrement utiles isolément. Par exemple, il est possible d'obtenir un rappel parfait en récupérant simplement chaque élément de l'ensemble de données. Inversement, une précision parfaite peut être obtenue en sélectionnant seulement un très petit nombre d'éléments extrêmement probables, même si de nombreux éléments pertinents sont manqués. Par conséquent, la précision et le rappel sont généralement évalués ensemble.

Dans une tâche de classification, un score de précision de 1,0 pour une classe C signifie que chaque élément étiqueté comme appartenant à la classe C appartient effectivement à cette classe, mais cela ne dit rien sur le nombre d'éléments de la classe C qui n'ont pas été correctement étiquetés. Un rappel de 1,0 signifie que chaque élément de la classe C a été étiqueté comme appartenant à la classe C, mais cela ne dit rien sur le nombre d'éléments d'autres classes qui ont été incorrectement étiquetés comme classe C.

Le compromis précision-rappel

Souvent, il existe une relation inverse entre la précision et le rappel. Augmenter l'un réduit généralement l'autre, mais le contexte de l'application peut déterminer quelle métrique est la plus valorisée. Par exemple, un détecteur de fumée est généralement conçu pour commettre de nombreuses erreurs de type I, en alertant dans des situations où il n'y a pas de danger, car le coût d'une erreur de type II (ne pas déclencher l'alarme lors d'un incendie majeur) est prohibitif. Les détecteurs de fumée sont donc conçus en pensant au rappel, en capturant tous les dangers réels même au prix de nombreuses fausses alertes.

En revanche, le système de justice pénale met souvent l'accent sur la précision, comme le reflète le ratio de Blackstone : « Il vaut mieux que dix coupables s'échappent que de voir un innocent souffrir. » Ce principe souligne le coût d'une erreur de type I (condamner une personne innocente). Ainsi, le système est orienté vers la précision, évitant les condamnations injustes même au prix de laisser plus de coupables en liberté, ce qui réduit le rappel.

Un chirurgien du cerveau retirant une tumeur cancéreuse illustre également ce compromis. Le chirurgien doit retirer toutes les cellules tumorales pour prévenir la régénération, mais doit aussi éviter de retirer des cellules cérébrales saines pour préserver la fonction cérébrale. Si le chirurgien est plus libéral dans la zone du cerveau qu'il retire, il augmente le rappel (retirer toutes les cellules cancéreuses) mais réduit la précision (retirer des cellules saines). Si le chirurgien est plus conservateur, il augmente la précision mais réduit le rappel. Un rappel plus élevé augmente les chances de retirer toutes les cellules cancéreuses mais augmente aussi le risque de retirer des cellules saines. Une précision plus élevée diminue le risque de retirer des cellules saines mais diminue aussi les chances de retirer toutes les cellules cancéreuses.

Courbes précision-rappel et métriques combinées

En pratique, les scores de précision et de rappel ne sont pas discutés isolément. Une courbe précision-rappel trace la précision en fonction du rappel, montrant généralement que la précision diminue à mesure que le rappel augmente. Cette courbe fournit une vue complète de la performance d'un modèle à travers différents seuils. Alternativement, les valeurs d'une mesure peuvent être comparées pour un niveau fixe de l'autre, comme la précision à un niveau de rappel de 0,75.

Plusieurs métriques combinées intègrent à la fois la précision et le rappel. Le score F1, la moyenne harmonique de la précision et du rappel, est largement utilisé pour résumer la performance d'un modèle en un seul nombre. Le score F1 est particulièrement utile lorsque la distribution des classes est déséquilibrée, car il équilibre le compromis entre la précision et le rappel. D'autres métriques, comme l'aire sous la courbe précision-rappel, sont également utilisées pour évaluer les modèles, en particulier dans les tâches de Machine learning où les classes positives sont rares.

Applications en apprentissage automatique

La précision et le rappel sont essentiels dans de nombreuses applications de Machine learning, en particulier dans les systèmes d'Artificial intelligence où les erreurs de classification ont des conséquences différentes. Par exemple, dans l'évaluation des Large language model, la précision et le rappel peuvent être utilisés pour évaluer la pertinence des réponses générées ou des documents récupérés. Dans les classificateurs basés sur les Neural network, ces métriques guident la sélection des seuils de décision et le réglage des paramètres du modèle.

Dans les problèmes de classification déséquilibrés, tels que la détection de fraude ou le diagnostic médical, l'exactitude est souvent trompeuse car la classe majoritaire domine. La précision et le rappel offrent une vue plus nuancée, permettant aux praticiens d'optimiser pour les coûts spécifiques des faux positifs et des faux négatifs. Des techniques telles que la Data Augmentation et les Loss Functions sont souvent employées pour améliorer la précision et le rappel dans de tels scénarios.

Limites et considérations

Bien que la précision et le rappel soient puissants, ils ont des limites. Ils ne tiennent pas compte des vrais négatifs, ce qui peut être important dans certains contextes. Par exemple, dans un problème de classification binaire avec un grand nombre d'instances négatives, un modèle avec une précision et un rappel élevés pourrait encore avoir de nombreux faux positifs, ce qui pourrait être problématique. De plus, la précision et le rappel sont sensibles au choix de la classe positive, et les définitions peuvent être ambiguës dans des contextes multi-classes.

En outre, la précision et le rappel ne sont pas directement comparables entre différents ensembles de données ou tâches, car ils dépendent du taux de base de la classe positive. Un modèle avec un rappel élevé sur un ensemble de données de maladies rares peut ne pas bien performer sur une condition courante. Par conséquent, il est important de considérer le contexte et les coûts associés aux différents types d'erreurs lors de l'interprétation de ces métriques.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:classification·evaluation-metrics·machine-learning·information-retrieval
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique