Detección de anomalías

Traducido del inglés

La detección de anomalías identifica elementos, eventos u observaciones raros que se desvían significativamente del comportamiento normal en un conjunto de datos. Se utiliza en ciberseguridad, medicina, finanzas y más, con técnicas que van desde métodos supervisados hasta no supervisados.

En el análisis de datos, la detección de anomalías es la identificación de elementos, eventos u observaciones raros que se desvían significativamente de la mayoría de los datos y no se ajustan a una noción bien definida de comportamiento normal. Dichos ejemplos pueden suscitar sospechas de haber sido generados por un mecanismo diferente o parecer inconsistentes con el resto del conjunto de datos. El concepto también se conoce como detección de valores atípicos y, a veces, como detección de novedades, dependiendo del contexto y del dominio de aplicación.

La detección de anomalías encuentra aplicación en numerosos dominios, incluidos la ciberseguridad, la medicina, la visión artificial, la estadística, la neurociencia, la aplicación de la ley y la detección de fraudes financieros. Históricamente, las anomalías se buscaban primero para su rechazo u omisión clara de los datos con el fin de ayudar al análisis estadístico, como el cálculo de la media o la desviación estándar. También se eliminaban para mejorar las predicciones de modelos como la regresión lineal y, más recientemente, su eliminación ayuda al rendimiento de los algoritmos de aprendizaje automático. Sin embargo, en muchas aplicaciones, las anomalías en sí mismas son de interés primordial y son las observaciones más deseadas en todo el conjunto de datos, necesitando identificación y separación del ruido o de valores atípicos irrelevantes.

Definición y terminología

La detección de anomalías es la identificación de observaciones, eventos o patrones que se apartan sustancialmente del comportamiento normal esperado en un entorno particular. No existe una definición operativa única que se aplique universalmente en todos los dominios, porque la noción de normalidad depende de los datos, la representación de las observaciones, el contexto en el que ocurren y los supuestos hechos por el método de detección.

Una anomalía no es necesariamente un error de datos. Dependiendo de la aplicación, puede representar un error de medición o registro, un cambio en el proceso que generó los datos, una observación inusual pero válida, o un evento de interés como fraude, fallo de equipo o intrusión de seguridad. Las anomalías tampoco se definen únicamente por su rareza o distancia de otras observaciones; diferentes métodos caracterizan la normalidad utilizando distribuciones de probabilidad, distancias o densidades locales, pertenencia a conglomerados, límites alrededor de datos normales, errores de predicción, errores de reconstrucción u otros criterios específicos del modelo.

Muchos métodos de detección de anomalías devuelven una puntuación de anomalía numérica en lugar de una etiqueta categórica inmediata. La puntuación representa el grado en que una observación se aparta del modelo de normalidad ajustado y se convierte en una decisión binaria aplicando un umbral de decisión. En consecuencia, si una observación se etiqueta como anómala depende del modelo de normalidad, del contexto disponible y de la regla de decisión utilizada.

Tipos de anomalías

Una clasificación ampliamente utilizada distingue tres tipos de anomalías. Una anomalía puntual es una observación individual considerada anómala en relación con el resto de los datos - por ejemplo, una transacción inusualmente grande en comparación con otras transacciones en un conjunto de datos. Una anomalía contextual, también llamada anomalía condicional, es anómala solo dentro de un contexto particular - una observación puede ser normal bajo un conjunto de circunstancias pero anómala bajo otro, como una temperatura que es normal en verano pero inusual en invierno. El contexto puede ser temporal, espacial, demográfico o definido de otra manera por la aplicación. Una anomalía colectiva es una colección relacionada de observaciones que es anómala en su conjunto, incluso cuando las observaciones individuales no son anómalas por sí mismas - por ejemplo, una subsecuencia inusual en una serie temporal o un patrón inesperado de actividad en una red informática.

La categoría apropiada depende en parte de la estructura de los datos. Los métodos de anomalía puntual pueden ser suficientes para observaciones independientes, mientras que las series temporales, los datos espaciales, las secuencias y los grafos a menudo requieren que las relaciones contextuales o colectivas se modelen explícitamente.

Términos relacionados

Los términos anomalía, valor atípico y novedad a veces se usan indistintamente, pero su uso varía entre la estadística, el Machine learning, el procesamiento de señales y los dominios de aplicación individuales. Un valor atípico comúnmente denota una observación que parece inconsistente con otras observaciones en un conjunto de datos; los métodos de detección de valores atípicos a menudo permiten que tales observaciones estén presentes en los datos utilizados para ajustar el modelo. En la detección de novedades, se asume generalmente que los datos de entrenamiento representan el comportamiento normal, y las observaciones de prueba no vistas previamente se evalúan contra el modelo de normalidad resultante. La detección de novedades se formula consecuentemente a menudo como una forma de clasificación de una clase. Estas distinciones no se aplican de manera consistente en toda la literatura, y el término más amplio detección de anomalías frecuentemente incluye todos estos escenarios.

Técnicas y categorías

Existen tres categorías amplias de técnicas de detección de anomalías. Las técnicas de detección de anomalías supervisadas requieren un conjunto de datos etiquetado como "normal" y "anormal" e implican entrenar un clasificador. Sin embargo, este enfoque rara vez se usa porque los datos etiquetados generalmente no están disponibles y las clases están inherentemente desequilibradas. Las técnicas de detección de anomalías semisupervisadas asumen que alguna porción de los datos está etiquetada - típicamente datos normales - y construyen un modelo que representa el comportamiento normal, luego prueban la probabilidad de que una instancia de prueba haya sido generada por el modelo. Las técnicas de detección de anomalías no supervisadas asumen que los datos no están etiquetados y son, con mucho, las más utilizadas debido a su aplicación más amplia y relevante.

Métodos estadísticos

Los enfoques estadísticos modelan el comportamiento normal de los datos utilizando distribuciones de probabilidad. Los métodos incluyen técnicas paramétricas como los modelos de mezcla gaussiana y técnicas no paramétricas basadas en histogramas o estimación de densidad por núcleo. Las observaciones con baja probabilidad bajo el modelo ajustado se marcan como anomalías. Estos métodos a menudo asumen independencia entre las observaciones:anomalías, haciéndolos menos adecuados para datos estructurados complejos sin adaptación.

Métodos basados en distancia y densidad

Los métodos basados en distancia caracterizan una observación como anómala si está lejos de sus vecinos más cercanos. Los métodos basados en densidad, como el factor de outlier local, comparan la densidad local alrededor de una observación con la de sus vecinos; las observaciones en regiones de densidad significativamente menor se marcan. Estos métodos son particularmente útiles para identificar anomalías puntuales en conjuntos de datos con densidades variables y no requieren supuestos a priori sobre la distribución de los datos.

Métodos basados en agrupamiento

La detección de anomalías basada en agrupamiento agrupa los datos en conglomerados e identifica anomalías como puntos que no pertenecen a ningún conglomerado, están lejos de los centroides de los conglomerados o pertenecen a conglomerados muy pequeños. Algoritmos como k-means y DBSCAN se han adaptado para este propósito. El enfoque es intuitivo y puede ser eficiente, pero el rendimiento depende del algoritmo de agrupamiento elegido y sus parámetros, y la definición de lo que constituye un conglomerado anómalo varía según la aplicación.

Enfoques de aprendizaje automático y aprendizaje profundo

La detección de anomalías moderna depende cada vez más de técnicas de aprendizaje automático y aprendizaje profundo. Los autoencoders, un tipo de red neuronal, aprenden a reconstruir datos normales; un alto error de reconstrucción indica una anomalía. Las máquinas de vectores de soporte de una clase aprenden un límite alrededor de los datos normales en un espacio de características de alta dimensión. También se han explorado métodos basados en arquitecturas transformer y modelos de lenguaje grandes para detectar anomalías en datos secuenciales, como registros o series temporales, aprovechando su capacidad para modelar dependencias de largo alcance y patrones contextuales.

Aplicaciones

Ciberseguridad

La detección de anomalías es un componente fundamental de los sistemas de detección de intrusiones. El concepto evolucionó significativamente con el tiempo, comenzando como un proceso manual donde los administradores de sistemas monitoreaban actividades inusuales, como el acceso a la cuenta de un usuario de vacaciones o actividad de impresora inesperada. A finales de los años 1970 y principios de los 1980, el análisis de registros de auditoría y registros del sistema era principalmente retrospectivo para la investigación de incidentes, ya que el volumen de datos hacía impracticable el monitoreo en tiempo real. La asequibilidad del almacenamiento digital permitió el análisis en línea de registros de auditoría con programas especializados, aunque estos programas típicamente se ejecutaban durante horas de baja demanda debido a la intensidad computacional. Los años 1990 trajeron sistemas de detección de intrusiones en tiempo real capaces de analizar datos de auditoría a medida que se generaban, cambiando a la detección proactiva. Los sistemas modernos aplican la detección de anomalías al tráfico de red, el comportamiento del usuario y las actividades de los puntos finales para identificar ataques de día cero, amenazas internas y otros patrones maliciosos.

Detección de fraude financiero

En finanzas, la detección de anomalías identifica transacciones fraudulentas, como fraude con tarjetas de crédito, abuso de reclamaciones de seguros y lavado de dinero. Patrones inusuales en montos de transacciones, frecuencia o ubicación geográfica pueden activar alertas para una mayor investigación. El campo se beneficia tanto de métodos supervisados que utilizan etiquetas históricas de fraude como de métodos no supervisados para descubrir esquemas de fraude novedosos.

Medicina y atención médica

Las aplicaciones médicas incluyen la detección de señales fisiológicas anormales, la identificación de respuestas inesperadas a tratamientos y el marcado de anomalías en imágenes médicas como resonancias magnéticas o tomografías computarizadas. Estos sistemas ayudan a los clínicos a centrar la atención en casos que se desvían de las normas establecidas, potencialmente mejorando el diagnóstico de condiciones raras o la detección temprana de fallos de equipos.

Fabricación y mantenimiento predictivo

En entornos industriales, la detección de anomalías monitorea lecturas de sensores de equipos para predecir fallos antes de que ocurran. Patrones de vibración inusuales, picos de temperatura o firmas acústicas pueden indicar averías inminentes, permitiendo a los equipos de mantenimiento intervenir proactivamente. Esto reduce el tiempo de inactividad y los costos de mantenimiento en sectores como la fabricación, la aviación y la energía.

Desafíos y limitaciones

La detección de anomalías enfrenta varios desafíos persistentes. La definición de normalidad a menudo cambia con el tiempo, requiriendo que los modelos se adapten a la deriva de concepto. La rareza de las anomalías hace que los datos etiquetados sean escasos, limitando los enfoques supervisados y complicando la evaluación. Los conjuntos de datos desequilibrados pueden llevar a altas tasas de falsos positivos, que son costosas en dominios como la ciberseguridad donde los analistas deben clasificar numerosas alertas. Además, las anomalías dependen del contexto, y los métodos que funcionan bien en observaciones puntuales independientes pueden fallar en datos estructurados como grafos o secuencias sin modelado contextual explícito.

La elección del umbral de decisión es crítica; bajarlo aumenta la tasa de detección pero también eleva las falsas alarmas, mientras que subirlo puede perder anomalías sutiles. No existe una métrica universalmente aceptada para comparar métodos de detección de anomalías entre dominios, ya que los costos relativos de falsos positivos y falsos negativos varían significativamente según la aplicación.

Relación con otros campos

La detección de anomalías se cruza con varias áreas de inteligencia artificial y estadística. En IA generativa, modelos como los transformers pueden usarse para estimar la probabilidad de secuencias, proporcionando una base para detectar entradas inusuales. La investigación en instituciones como MIT CSAIL y Stanford AI Lab ha contribuido a los fundamentos teóricos y algoritmos prácticos. Empresas como Amazon Web Services y Google Cloud ofrecen servicios de detección de anomalías como parte de sus plataformas en la nube, integrándose con pipelines de aprendizaje automático. El campo también se basa en el trabajo en análisis de series temporales, procesamiento de señales y estadística robusta, e informa prácticas en gestión de calidad de datos y monitoreo de sistemas.

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:anomaly-detection·data-analysis·statistical-methods·machine-learning
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial