Precisión y recuperación

Traducido del inglés

Precisión y exhaustividad son métricas de clasificación que miden, respectivamente, la fracción de instancias relevantes recuperadas y la fracción de instancias relevantes recuperadas, utilizadas especialmente para tareas desequilibradas.

La precisión y la exhaustividad son dos métricas de rendimiento fundamentales utilizadas en la clasificación y la recuperación de información para evaluar la calidad de las predicciones de un modelo. La precisión, también llamada valor predictivo positivo, mide la fracción de instancias relevantes entre todas las instancias recuperadas. La exhaustividad, también conocida como sensibilidad, mide la fracción de instancias relevantes que se recuperaron con éxito. Ambas métricas se basan en el concepto de relevancia, que normalmente se define según la tarea específica, como identificar una clase particular en un conjunto de datos.

En una tarea de clasificación, la precisión para una clase determinada es el número de verdaderos positivos (elementos etiquetados correctamente como pertenecientes a la clase) dividido por el número total de elementos etiquetados como pertenecientes a esa clase, que es la suma de verdaderos positivos y falsos positivos. La exhaustividad es el número de verdaderos positivos dividido por el número total de elementos que realmente pertenecen a la clase, que es la suma de verdaderos positivos y falsos negativos. Estas definiciones se alinean con las fórmulas generales: la precisión es igual a las instancias relevantes recuperadas divididas por todas las instancias recuperadas, y la exhaustividad es igual a las instancias relevantes recuperadas divididas por todas las instancias relevantes.

Considere un programa informático diseñado para reconocer perros en fotografías digitales. Si una imagen contiene diez gatos y doce perros, y el programa identifica ocho elementos como perros, de los cuales cinco son realmente perros (verdaderos positivos) y tres son gatos (falsos positivos), entonces siete perros se pasan por alto (falsos negativos) y siete gatos se excluyen correctamente (verdaderos negativos). La precisión del programa es 5/8, ya que solo cinco de los ocho elementos seleccionados son relevantes. Su exhaustividad es 5/12, porque solo cinco de los doce perros relevantes se recuperan. Este ejemplo ilustra cómo la precisión y la exhaustividad capturan diferentes aspectos del rendimiento.

Relación con la Prueba de Hipótesis

La precisión y la exhaustividad pueden entenderse a través del enfoque de la prueba de hipótesis. En una configuración típica, la hipótesis nula es que un elemento dado es irrelevante (por ejemplo, no es un perro). Un error de tipo I ocurre cuando un elemento relevante se rechaza incorrectamente, lo que corresponde a un falso positivo. Un error de tipo II ocurre cuando un elemento irrelevante se acepta incorrectamente, lo que corresponde a un falso negativo. Una precisión perfecta (sin falsos positivos) es equivalente a no tener errores de tipo I, mientras que una exhaustividad perfecta (sin falsos negativos) es equivalente a no tener errores de tipo II.

Más generalmente, la exhaustividad es el complemento de la tasa de error de tipo II, lo que significa que la exhaustividad es igual a uno menos la tasa de falsos negativos. La precisión está relacionada con la tasa de error de tipo I, pero de una manera más compleja, ya que también depende de la distribución previa de elementos relevantes e irrelevantes en la población. En el ejemplo de los perros, hay tres errores de tipo I (falsos positivos) entre diez gatos en total, lo que da una tasa de error de tipo I de 3/10. Hay siete errores de tipo II (falsos negativos) entre doce perros, lo que da una tasa de error de tipo II de 7/12.

Precisión como Calidad, Exhaustividad como Cantidad

La precisión a menudo se considera una medida de calidad, que indica cuántos de los elementos recuperados son realmente relevantes. Una alta precisión significa que un algoritmo devuelve más resultados relevantes que irrelevantes. La exhaustividad, por otro lado, es una medida de cantidad, que indica cuántos de los elementos relevantes se recuperan. Una alta exhaustividad significa que un algoritmo devuelve la mayoría de los resultados relevantes, ya sea que también se devuelvan resultados irrelevantes o no.

Estas métricas no son particularmente útiles de forma aislada. Por ejemplo, es posible lograr una exhaustividad perfecta simplemente recuperando cada elemento del conjunto de datos. Por el contrario, se puede lograr una precisión perfecta seleccionando solo un número muy pequeño de elementos extremadamente probables, incluso si se pierden muchos elementos relevantes. Por lo tanto, la precisión y la exhaustividad se evalúan típicamente juntas.

En una tarea de clasificación, una puntuación de precisión de 1.0 para una clase C significa que cada elemento etiquetado como perteneciente a la clase C realmente pertenece a esa clase, pero no dice nada sobre cuántos elementos de la clase C no se etiquetaron correctamente. Una exhaustividad de 1.0 significa que cada elemento de la clase C se etiquetó como perteneciente a la clase C, pero no dice nada sobre cuántos elementos de otras clases se etiquetaron incorrectamente como clase C.

El Compromiso entre Precisión y Exhaustividad

A menudo, existe una relación inversa entre la precisión y la exhaustividad. Aumentar una típicamente reduce la otra, pero el contexto de la aplicación puede dictar qué métrica se valora más. Por ejemplo, un detector de humo generalmente está diseñado para cometer muchos errores de tipo I, alertando en situaciones donde no hay peligro, porque el costo de un error de tipo II (no hacer sonar una alarma durante un incendio importante) es prohibitivamente alto. Los detectores de humo se diseñan por lo tanto con la exhaustividad en mente, capturando todos los peligros reales incluso a costa de muchas falsas alarmas.

En contraste, el sistema de justicia penal a menudo enfatiza la precisión, como se refleja en la proporción de Blackstone: "Es mejor que diez personas culpables escapen a que un inocente sufra". Este principio destaca el costo de un error de tipo I (condenar a una persona inocente). Como tal, el sistema está orientado hacia la precisión, evitando condenas erróneas incluso a costa de dejar que más personas culpables queden libres, lo que reduce la exhaustividad.

Un cirujano cerebral que extirpa un tumor canceroso ilustra también el compromiso. El cirujano debe eliminar todas las células tumorales para prevenir la regeneración, pero también debe evitar eliminar células cerebrales sanas para preservar la función cerebral. Si el cirujano es más liberal en el área del cerebro que elimina, aumenta la exhaustividad (eliminando todas las células cancerosas) pero reduce la precisión (eliminando células sanas). Si el cirujano es más conservador, aumenta la precisión pero reduce la exhaustividad. Una mayor exhaustividad aumenta las posibilidades de eliminar todas las células cancerosas pero también aumenta el riesgo de eliminar células sanas. Una mayor precisión disminuye el riesgo de eliminar células sanas pero también disminuye las posibilidades de eliminar todas las células cancerosas.

Curvas de Precisión-Exhaustividad y Métricas Combinadas

En práctica, las puntuaciones de precisión y exhaustividad no se discuten de forma aislada. Una curva de precisión-exhaustividad traza la precisión como una función de la exhaustividad, mostrando típicamente que la precisión disminuye a medida que la exhaustividad aumenta. Esta curva proporciona una visión integral del rendimiento de un modelo a través de diferentes umbrales. Alternativamente, los valores de una medida se pueden comparar para un nivel fijo de la otra, como la precisión en un nivel de exhaustividad de 0.75.

Varias métricas combinadas incorporan tanto la precisión como la exhaustividad. La puntuación F1, la media armónica de precisión y exhaustividad, se usa ampliamente para resumir el rendimiento de un modelo en un solo número. La puntuación F1 es particularmente útil cuando la distribución de clases está desequilibrada, ya que equilibra el compromiso entre precisión y exhaustividad. Otras métricas, como el área bajo la curva de precisión-exhaustividad, también se utilizan para evaluar modelos, especialmente en tareas de Machine learning donde las clases positivas son raras.

Aplicaciones en el Aprendizaje Automático

La precisión y la exhaustividad son esenciales en muchas aplicaciones de Machine learning, particularmente en sistemas de Artificial intelligence donde los errores de clasificación tienen consecuencias diferentes. Por ejemplo, en la evaluación de Large language model, la precisión y la exhaustividad se pueden usar para evaluar la relevancia de las respuestas generadas o los documentos recuperados. En clasificadores basados en Neural network, estas métricas guían la selección de umbrales de decisión y el ajuste de parámetros del modelo.

En problemas de clasificación desequilibrados, como la detección de fraude o el diagnóstico médico, la exactitud a menudo es engañosa porque la clase mayoritaria domina. La precisión y la exhaustividad proporcionan una visión más matizada, permitiendo a los profesionales optimizar para los costos específicos de falsos positivos y falsos negativos. Técnicas como Data Augmentation y Loss Functions se emplean a menudo para mejorar la precisión y la exhaustividad en tales escenarios.

Limitaciones y Consideraciones

Aunque la precisión y la exhaustividad son poderosas, tienen limitaciones. No tienen en cuenta los verdaderos negativos, que pueden ser importantes en algunos contextos. Por ejemplo, en un problema de clasificación binaria con un gran número de instancias negativas, un modelo con alta precisión y exhaustividad podría aún tener muchos falsos positivos, lo que podría ser problemático. Además, la precisión y la exhaustividad son sensibles a la elección de la clase positiva, y las definiciones pueden ser ambiguas en configuraciones de múltiples clases.

Además, la precisión y la exhaustividad no son directamente comparables entre diferentes conjuntos de datos o tareas, ya que dependen de la tasa base de la clase positiva. Un modelo con alta exhaustividad en un conjunto de datos de enfermedades raras puede no funcionar bien en una condición común. Por lo tanto, es importante considerar el contexto y los costos asociados con diferentes tipos de errores al interpretar estas métricas.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:classification·evaluation-metrics·machine-learning·information-retrieval
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial