Una curva de precisión-recall es una representación gráfica utilizada en clasificación para evaluar el rendimiento de un modelo, trazando la precisión (valor predictivo positivo) en el eje y frente al recall (sensibilidad) en el eje x para diversos umbrales de decisión. Cada punto de la curva corresponde a un ajuste de umbral específico, mostrando cómo cambian la precisión y el recall al ajustar el umbral. La curva es particularmente útil para conjuntos de datos desequilibrados donde una clase es rara, ya que se centra en el rendimiento de la clase positiva en lugar de los verdaderos negativos.
La precisión se define como la fracción de instancias relevantes entre las instancias recuperadas, o equivalentemente, el número de verdaderos positivos dividido por la suma de verdaderos positivos y falsos positivos. El recall es la fracción de instancias relevantes que fueron recuperadas, o el número de verdaderos positivos dividido por la suma de verdaderos positivos y falsos negativos. En una tarea de clasificación, un clasificador perfecto tendría tanto precisión como recall iguales a 1.0, produciendo una curva que pasa por la esquina superior derecha. Sin embargo, en la práctica, a menudo existe una relación inversa: aumentar el recall tiende a disminuir la precisión, y viceversa. Una curva de precisión-recall típicamente desciende desde una alta precisión en bajo recall hasta una menor precisión en alto recall, aunque la forma exacta depende del modelo y los datos.
Relación con los errores de tipo I y tipo II
La precisión y el recall están estrechamente vinculados a los conceptos de prueba de hipótesis. El recall es el complemento de la tasa de error de tipo II (tasa de falsos negativos), lo que significa que un alto recall corresponde a pocas instancias positivas omitidas. La precisión está relacionada con la tasa de error de tipo I (tasa de falsos positivos) pero también depende de la distribución previa de instancias positivas y negativas. Por ejemplo, en un conjunto de datos con diez gatos y doce perros, un programa de reconocimiento de perros que identifica ocho perros, de los cuales cinco son realmente perros, tiene una precisión de 5/8 y un recall de 5/12. La tasa de error de tipo I es 3/10 (tres falsos positivos entre diez gatos), y la tasa de error de tipo II es 7/12 (siete falsos negativos entre doce perros). La precisión puede verse como una medida de calidad (cuántos elementos seleccionados son relevantes), mientras que el recall es una medida de cantidad (cuántos elementos relevantes son seleccionados).
Compromisos y ejemplos prácticos
El compromiso entre precisión y recall a menudo depende del contexto. Por ejemplo, un detector de humo está diseñado para priorizar el recall, porque el costo de no detectar un incendio (un falso negativo) es catastrófico, incluso si implica muchas alarmas falsas (baja precisión). Por el contrario, el sistema de justicia penal, guiado por la proporción de Blackstone - "Es mejor que diez personas culpables escapen a que un inocente sufra" - prioriza la precisión, aceptando un menor recall para evitar condenar a personas inocentes. Un cirujano cerebral que extirpa un tumor enfrenta un dilema similar: extirpar un área más grande aumenta el recall (asegurando que todas las células cancerosas sean eliminadas) pero reduce la precisión (eliminando tejido sano), mientras que un enfoque conservador aumenta la precisión pero corre el riesgo de dejar células cancerosas.
Construcción e interpretación
Para construir una curva de precisión-recall, un modelo produce una puntuación o probabilidad para cada instancia. Al variar el umbral por encima del cual una instancia se clasifica como positiva, se obtienen diferentes pares de valores de precisión y recall. Estos pares se trazan como una curva. El área bajo la curva de precisión-recall (PR-AUC) es un resumen de un solo número de la curva, donde valores más altos indican un mejor rendimiento general. Un clasificador aleatorio típicamente produce una curva que es una línea horizontal en la proporción de instancias positivas en el conjunto de datos, por lo que el PR-AUC para un modelo útil debe estar por encima de esta línea base. La curva es especialmente informativa cuando la clase positiva es rara, ya que la matriz de confusión por sí sola puede ser engañosa.
Uso en aprendizaje automático
Las curvas de precisión-recall se utilizan ampliamente en Machine learning y Artificial intelligence para evaluar clasificadores binarios, particularmente en dominios como la recuperación de información, el diagnóstico médico y la detección de fraude. A menudo se comparan con las curvas de características operativas del receptor (ROC), que trazan la tasa de verdaderos positivos frente a la tasa de falsos positivos. A diferencia de las curvas ROC, las curvas de precisión-recall no incluyen verdaderos negativos, lo que las hace más sensibles al rendimiento en la clase positiva. Muchos marcos de Neural network y Deep learning proporcionan funciones integradas para calcular y trazar curvas de precisión-recall, facilitando la selección de modelos y el ajuste de umbrales. Por ejemplo, en tareas de Natural language processing como la clasificación de documentos, una curva de precisión-recall puede ayudar a equilibrar la recuperación de documentos relevantes frente a la inclusión de documentos irrelevantes.
Limitaciones y consideraciones
Las curvas de precisión-recall tienen limitaciones. Son sensibles al desequilibrio de clases, y un modelo con alta precisión y recall en un conjunto de datos equilibrado puede funcionar mal en uno desequilibrado. Además, la curva no transmite el número absoluto de instancias, por lo que comparar curvas entre diferentes conjuntos de datos puede ser engañoso. También es posible lograr un recall perfecto recuperando cada instancia, pero tal modelo tendría baja precisión. Por el contrario, se puede lograr una precisión perfecta seleccionando solo las instancias más seguras, pero el recall sería bajo. Por lo tanto, la precisión y el recall rara vez se discuten de forma aislada; en cambio, la curva proporciona una visión integral del compromiso, permitiendo a los profesionales elegir un umbral que se alinee con las prioridades de la aplicación.