Una curva característica operativa del receptor, o curva ROC, es una representación gráfica que ilustra el rendimiento de un modelo clasificador binario en diferentes valores de umbral. Aunque puede generalizarse a múltiples clases, se aplica con mayor frecuencia a problemas de clasificación binaria. El análisis ROC se utiliza a menudo en la evaluación del rendimiento de pruebas diagnósticas en epidemiología clínica, así como en aprendizaje automático, radiología, biometría y predicción. La curva proporciona una visión integral del equilibrio entre sensibilidad y especificidad en todos los umbrales de clasificación posibles, lo que permite comparar modelos sin especificar un punto de operación particular.
La curva ROC es la representación de la tasa de verdaderos positivos (TPR) frente a la tasa de falsos positivos (FPR) en cada configuración de umbral. La tasa de verdaderos positivos, también conocida como sensibilidad o probabilidad de detección, mide la proporción de positivos reales identificados correctamente. La tasa de falsos positivos, también conocida como probabilidad de falsa alarma, es igual a 1 menos la especificidad y mide la proporción de negativos reales clasificados incorrectamente como positivos. La curva también puede interpretarse como una representación del poder estadístico en función del error de Tipo I de la regla de decisión. Cuando se conocen las distribuciones de probabilidad tanto para los resultados verdaderos positivos como para los falsos positivos, la curva ROC se obtiene como la función de distribución acumulativa de la probabilidad de detección en el eje y frente a la función de distribución acumulativa de la probabilidad de falsos positivos en el eje x.
El análisis ROC proporciona herramientas para seleccionar modelos posiblemente óptimos y descartar los subóptimos de manera independiente y previa a la especificación del contexto de costos o la distribución de clases. Está relacionado de manera directa y natural con el análisis de costo/beneficio en la toma de decisiones diagnósticas. El área bajo la curva ROC (AUC) es un valor escalar único que resume el rendimiento general de un clasificador, donde valores cercanos a 1 indican una mejor discriminación y 0.5 indica un rendimiento equivalente al azar.
Terminología
La tasa de verdaderos positivos también se conoce como sensibilidad, recuerdo o probabilidad de detección. La tasa de falsos positivos también se conoce como probabilidad de falsa alarma y es igual a 1 menos la especificidad. La curva ROC también se conoce como curva característica operativa relativa, porque es una comparación de dos características operativas (TPR y FPR) a medida que cambia el criterio. En algunos campos, la curva se denomina representación de sensibilidad frente a (1 menos especificidad). Los términos "positivo" y "negativo" se refieren a las etiquetas de clase predichas, mientras que "verdadero" y "falso" indican si la predicción coincide con la verdad fundamental real.
Historia
La curva ROC fue desarrollada por primera vez por ingenieros eléctricos y de radar durante la Segunda Guerra Mundial para detectar objetos enemigos en campos de batalla, a partir de 1941. Este origen dio lugar a su nombre, "característica operativa del receptor", ya que describía las características operativas de los receptores de radar. La técnica se introdujo pronto en la psicología para explicar la detección perceptual de estímulos, particularmente en la teoría de detección de señales. En las décadas siguientes, el análisis ROC se adoptó en medicina, radiología, biometría, predicción de peligros naturales, meteorología y evaluación del rendimiento de modelos. En los últimos años, se ha utilizado cada vez más en la investigación de aprendizaje automático y minería de datos como una herramienta estándar para evaluar modelos de clasificación.
Concepto Básico
Un modelo de clasificación es una asignación de instancias a ciertas clases o grupos. La salida del clasificador puede ser un valor real arbitrario, que requiere un umbral para determinar el límite de clase, o puede ser una etiqueta de clase discreta. Considere un problema de predicción de dos clases donde los resultados se etiquetan como positivos (p) o negativos (n). Cuatro resultados posibles surgen de un clasificador binario: un verdadero positivo (TP) ocurre cuando la predicción es p y el valor real es p; un falso positivo (FP) ocurre cuando la predicción es p pero el valor real es n; un verdadero negativo (TN) ocurre cuando tanto la predicción como el valor real son n; y un falso negativo (FN) ocurre cuando la predicción es n pero el valor real es p.
Por ejemplo, en una prueba diagnóstica para una enfermedad, un falso positivo ocurre cuando una persona da positivo pero no tiene realmente la enfermedad. Un falso negativo ocurre cuando una persona da negativo pero realmente tiene la enfermedad. Estos cuatro resultados pueden organizarse en una tabla de contingencia de 2x2, también conocida como matriz de confusión, que forma la base para calcular diversas métricas de evaluación.
Espacio ROC
El espacio ROC se define por la tasa de falsos positivos en el eje x y la tasa de verdaderos positivos en el eje y. Esta representación gráfica muestra los intercambios relativos entre verdaderos positivos (beneficios) y falsos positivos (costos). Cada resultado de predicción o instancia de una matriz de confusión representa un punto en el espacio ROC. El mejor método de predicción posible produciría un punto en la esquina superior izquierda, en las coordenadas (0,1), que representa 100% de sensibilidad (sin falsos negativos) y 100% de especificidad (sin falsos positivos). Este punto se denomina clasificación perfecta.
Una suposición aleatoria daría un punto a lo largo de la línea diagonal, llamada línea de no discriminación, que va desde la esquina inferior izquierda hasta la esquina superior derecha. Un ejemplo intuitivo de suposición aleatoria es una decisión lanzando una moneda. A medida que aumenta el tamaño de la muestra, el punto ROC de un clasificador aleatorio tiende hacia la línea diagonal; para una moneda equilibrada, tiende al punto (0.5, 0.5). La diagonal divide el espacio ROC: los puntos por encima de la diagonal representan buenos resultados de clasificación (mejor que el azar), mientras que los puntos por debajo representan malos resultados (peor que el azar). Notablemente, la salida de un predictor consistentemente malo puede invertirse para obtener un buen predictor, ya que reflejar un punto a través del centro (0.5, 0.5) produce un clasificador complementario.
Variación del Umbral
Una curva ROC se genera variando el umbral de clasificación y representando la TPR y FPR resultantes en cada configuración de umbral. Para un clasificador que produce una puntuación continua, bajar el umbral aumenta tanto la TPR como la FPR, mientras que subir el umbral disminuye ambas. La curva traza un camino desde el punto (0,0) en el umbral más alto (donde ninguna instancia se clasifica como positiva) hasta el punto (1,1) en el umbral más bajo (donde todas las instancias se clasifican como positivas). Cada punto en la curva corresponde a un valor de umbral específico, lo que permite a los profesionales seleccionar un punto de operación que equilibre sensibilidad y especificidad según los requisitos de la aplicación.
Área Bajo la Curva
El área bajo la curva ROC, comúnmente abreviada como AUC, es una métrica resumida ampliamente utilizada. La AUC representa la probabilidad de que una instancia positiva elegida al azar sea clasificada con una puntuación más alta que una instancia negativa elegida al azar por el clasificador. Una AUC de 1.0 indica discriminación perfecta, mientras que una AUC de 0.5 indica un rendimiento no mejor que el azar. Valores de AUC por debajo de 0.5 sugieren que el clasificador está funcionando peor que el azar, lo que puede indicar un error de etiquetado o que invertir las predicciones mejoraría el rendimiento. La AUC es particularmente útil para comparar múltiples clasificadores porque proporciona un número único que es independiente de la elección del umbral y de la distribución de clases.
Aplicaciones
El análisis ROC se aplica en numerosos dominios. En epidemiología clínica, se utiliza para evaluar la precisión de pruebas diagnósticas, como mediciones de presión arterial para hipertensión o biomarcadores para detección de enfermedades. En radiología, las curvas ROC ayudan a evaluar el rendimiento de técnicas de imagen y las interpretaciones de los radiólogos. En biometría, se utilizan para evaluar sistemas de reconocimiento de huellas dactilares y faciales. En meteorología, el análisis ROC se aplica a la verificación de pronósticos, como la predicción de peligros naturales. En aprendizaje automático, las curvas ROC son herramientas estándar para evaluar clasificadores binarios, incluidos los utilizados en modelos de aprendizaje profundo y redes neuronales. La técnica también es relevante para evaluar las salidas de modelos de lenguaje grandes en tareas como moderación de contenido o análisis de sentimiento, donde se toman decisiones binarias basadas en puntuaciones de confianza continuas.
Limitaciones y Consideraciones
Las curvas ROC tienen ciertas limitaciones. Están diseñadas principalmente para clasificación binaria, y aunque la generalización a múltiples clases es posible, requiere enfoques más complejos como estrategias uno contra el resto o uno contra uno. La curva no incorpora directamente los costos de falsos positivos y falsos negativos, que pueden variar según la aplicación. Además, cuando las distribuciones de clases están altamente desequilibradas, la curva ROC puede presentar una visión excesivamente optimista del rendimiento en comparación con las curvas de precisión-recuperación, que se centran en la clase positiva. A pesar de estas limitaciones, el análisis ROC sigue siendo una herramienta fundamental en la evaluación de modelos debido a su independencia del umbral y su representación gráfica intuitiva.