Precisión y recuperación son dos métricas de rendimiento fundamentales utilizadas para evaluar la calidad de un sistema de clasificación o de recuperación de información. Cuantifican qué tan bien un modelo identifica elementos relevantes de un conjunto de datos, equilibrando los costos de los falsos positivos y los falsos negativos. La precisión, también llamada valor predictivo positivo, mide la fracción de instancias recuperadas que son realmente relevantes. La recuperación, también conocida como sensibilidad, mide la fracción de todas las instancias relevantes que se recuperaron con éxito. Juntas, proporcionan una visión más matizada del comportamiento de un modelo que la exactitud por sí sola, particularmente cuando las clases están desequilibradas o cuando los costos de diferentes errores varían.
En términos formales, la precisión se calcula como el número de verdaderos positivos dividido por el número total de elementos que el sistema etiquetó como positivos (verdaderos positivos más falsos positivos). La recuperación se calcula como el número de verdaderos positivos dividido por el número total de elementos que realmente pertenecen a la clase positiva (verdaderos positivos más falsos negativos). Por ejemplo, considere un programa informático diseñado para reconocer perros en fotografías digitales. Si una imagen contiene diez gatos y doce perros, y el programa identifica ocho elementos como perros, de los cuales cinco son realmente perros (verdaderos positivos) y tres son gatos (falsos positivos), entonces siete perros se pasan por alto (falsos negativos) y siete gatos se excluyen correctamente (verdaderos negativos). La precisión del programa es 5/8, ya que solo cinco de los ocho elementos seleccionados son relevantes. Su recuperación es 5/12, ya que solo cinco de los doce perros relevantes fueron encontrados.
Relación con los Errores Estadísticos
La precisión y la recuperación se corresponden directamente con conceptos de la prueba de hipótesis estadística. Si la hipótesis nula es que un elemento dado es irrelevante, entonces un falso positivo (error de tipo I) ocurre cuando un elemento irrelevante se selecciona incorrectamente, y un falso negativo (error de tipo II) ocurre cuando un elemento relevante se pasa por alto. Una precisión perfecta corresponde a cero falsos positivos, lo que significa que cada elemento recuperado es relevante. Una recuperación perfecta corresponde a cero falsos negativos, lo que significa que cada elemento relevante se recupera. La recuperación es simplemente el complemento de la tasa de error de tipo II, calculada como uno menos esa tasa. La precisión está relacionada con la tasa de error de tipo I, pero de una manera más compleja, porque también depende de la distribución previa de elementos relevantes frente a irrelevantes en la población. En el ejemplo del reconocimiento de perros, hay tres errores de tipo I de diez gatos totales, lo que da una tasa de error de tipo I de 3/10, y siete errores de tipo II de doce perros, lo que da una tasa de error de tipo II de 7/12.
Interpretación y Utilidad
La precisión a menudo se describe como una medida de calidad, indicando qué tan confiables son las predicciones positivas. La recuperación es una medida de cantidad, indicando qué tan completa es la cobertura del sistema de la clase positiva. Una alta precisión significa que el algoritmo devuelve resultados mayormente relevantes, mientras que una alta recuperación significa que devuelve la mayoría de los resultados relevantes, incluso si también se incluyen algunos irrelevantes. Estas métricas no son particularmente útiles de forma aislada. Un sistema puede lograr una recuperación perfecta simplemente recuperando cada elemento de la colección, pero tal sistema tendría una precisión muy baja. Por el contrario, un sistema puede lograr una precisión perfecta seleccionando solo un único elemento que casi con certeza es relevante, pero esto sacrificaría la recuperación. En la práctica, la precisión y la recuperación generalmente se informan juntas, a menudo a través de una curva de precisión-recuperación que traza la precisión en función de la recuperación. Típicamente, la precisión disminuye a medida que aumenta la recuperación, reflejando el equilibrio inherente entre las dos.
El Equilibrio entre Precisión y Recuperación
A menudo existe una relación inversa entre precisión y recuperación, donde aumentar una tiene el costo de reducir la otra. El equilibrio óptimo depende de la aplicación específica y de los costos relativos de los diferentes tipos de errores. Un detector de humo es un ejemplo clásico de un sistema diseñado teniendo en cuenta la recuperación. Está intencionalmente propenso a falsas alarmas (errores de tipo I) porque el costo de no alertar durante un incendio real es prohibitivamente alto. El detector sacrifica la precisión para asegurar que captura todos los peligros genuinos. En contraste, el sistema de justicia penal, guiado por la proporción de Blackstone de que "es mejor que diez personas culpables escapen a que un inocente sufra", enfatiza la precisión. El sistema está diseñado para evitar condenar a personas inocentes, incluso si esto significa dejar que más individuos culpables queden libres, sacrificando así la recuperación.
Un cirujano cerebral que extrae un tumor canceroso ilustra el equilibrio a nivel individual. El cirujano debe eliminar todas las células tumorales para prevenir el recrecimiento, pero también debe evitar eliminar células cerebrales sanas para preservar la función. Un enfoque más liberal, que elimina un área más amplia alrededor del tumor, aumenta la recuperación al asegurar que todas las células cancerosas se extraen, pero también aumenta la probabilidad de eliminar tejido sano. Un enfoque más conservador aumenta la precisión al apuntar solo a células cancerosas confirmadas, pero corre el riesgo de dejar algunas células tumorales atrás. Ambos resultados tienen consecuencias significativas, y la elección del cirujano refleja los pesos relativos otorgados a la precisión y la recuperación en ese contexto.
Uso en Aprendizaje Automático
En aprendizaje automático, la precisión y la recuperación son métricas de evaluación estándar para modelos de clasificación, particularmente en dominios con conjuntos de datos desequilibrados. Por ejemplo, en diagnósticos médicos, un modelo que detecta una enfermedad rara podría tener una alta exactitud simplemente al predecir la clase mayoritaria, pero la precisión y la recuperación revelan su utilidad real. En la investigación de inteligencia artificial, estas métricas se utilizan para comparar modelos en tareas como detección de objetos, filtrado de spam y recuperación de documentos. También son fundamentales para métricas derivadas como la puntuación F1, que es la media armónica de precisión y recuperación, proporcionando un número único que equilibra ambas preocupaciones. Los conceptos se extienden más allá de la clasificación binaria a entornos multiclase, donde la precisión y la recuperación se calculan por clase y luego se agregan.
Aplicaciones en Recuperación de Información
La precisión y la recuperación se originaron en el campo de la recuperación de información, donde evalúan motores de búsqueda y sistemas de consulta de bases de datos. En este contexto, la precisión mide la proporción de documentos recuperados que son relevantes para la consulta del usuario, mientras que la recuperación mide la proporción de todos los documentos relevantes en la colección que se recuperaron. Los motores de búsqueda a menudo enfrentan un equilibrio: devolver más resultados puede aumentar la recuperación, pero puede diluir la precisión con páginas irrelevantes. Los sistemas de clasificación utilizan la precisión en un número fijo de resultados, como la precisión en 10, para evaluar la calidad de los resultados principales. Estas métricas siguen siendo centrales para evaluar los sistemas de recuperación modernos, incluidos aquellos impulsados por tecnologías de modelos de lenguaje grandes y IA generativa.
Limitaciones y Extensiones
La precisión y la recuperación tienen limitaciones. No tienen en cuenta los verdaderos negativos, que pueden ser importantes en algunas aplicaciones. También son sensibles a la elección de la clase positiva, y su interpretación depende de la probabilidad previa de la clase positiva. Cuando la clase positiva es rara, la recuperación puede ser difícil de mejorar sin introducir muchos falsos positivos. Para abordar estos problemas, los investigadores han desarrollado métricas relacionadas como la puntuación F1, el área bajo la curva de precisión-recuperación y el coeficiente de correlación de Matthews. En la práctica, la elección de la métrica depende de los objetivos de la aplicación, y la precisión y la recuperación a menudo se informan junto con otras estadísticas para proporcionar una imagen completa del rendimiento del modelo.