Em análise de dados, a detecção de anomalias é a identificação de itens, eventos ou observações raros que se desviam significativamente da maioria dos dados e não se conformam a uma noção bem definida de comportamento normal. Tais exemplos podem despertar suspeitas de serem gerados por um mecanismo diferente ou parecerem inconsistentes com o restante do conjunto de dados. O conceito também é referido como detecção de valores atípicos e, às vezes, como detecção de novidades, dependendo do contexto e do domínio de aplicação.
A detecção de anomalias encontra aplicação em diversos domínios, incluindo segurança cibernética, medicina, visão computacional, estatística, neurociência, aplicação da lei e detecção de fraudes financeiras. Historicamente, as anomalias eram primeiramente procuradas para rejeição ou omissão clara dos dados, a fim de auxiliar a análise estatística, como o cálculo da média ou do desvio padrão. Elas também eram removidas para melhorar as previsões de modelos como a regressão linear e, mais recentemente, sua remoção auxilia o desempenho de algoritmos de aprendizado de máquina. No entanto, em muitas aplicações, as próprias anomalias são de interesse primário e são as observações mais desejadas em todo o conjunto de dados, necessitando de identificação e separação de ruído ou valores atípicos irrelevantes.
Definição e terminologia
A detecção de anomalias é a identificação de observações, eventos ou padrões que se afastam substancialmente do comportamento normal esperado em um determinado contexto. Não existe uma definição operacional única que se aplique universalmente entre domínios, porque a noção de normalidade depende dos dados, da representação das observações, do contexto em que ocorrem e das suposições feitas pelo método de detecção.
Uma anomalia não é necessariamente um erro de dados. Dependendo da aplicação, pode representar um erro de medição ou registro, uma mudança no processo que gerou os dados, uma observação incomum, mas válida, ou um evento de interesse, como fraude, falha de equipamento ou intrusão de segurança. As anomalias também não são definidas apenas pela raridade ou distância de outras observações; diferentes métodos caracterizam a normalidade usando distribuições de probabilidade, distâncias ou densidades locais, associação a clusters, limites em torno de dados normais, erros de previsão, erros de reconstrução ou outros critérios específicos do modelo.
Muitos métodos de detecção de anomalias retornam uma pontuação numérica de anomalia em vez de um rótulo categórico imediato. A pontuação representa o grau em que uma observação se afasta do modelo de normalidade ajustado e é convertida em uma decisão binária pela aplicação de um limite de decisão. Consequentemente, se uma observação é rotulada como anômala depende do modelo de normalidade, do contexto disponível e da regra de decisão usada.
Tipos de anomalias
Uma classificação amplamente usada distingue três tipos de anomalias. Uma anomalia pontual é uma observação individual considerada anômala em relação ao restante dos dados - por exemplo, uma transação excepcionalmente grande em comparação com outras transações em um conjunto de dados. Uma anomalia contextual, também chamada de anomalia condicional, é anômala apenas dentro de um contexto particular - uma observação pode ser normal sob um conjunto de circunstâncias, mas anômala sob outra, como uma temperatura que é normal no verão, mas incomum no inverno. O contexto pode ser temporal, espacial, demográfico ou definido de outra forma pela aplicação. Uma anomalia coletiva é uma coleção relacionada de observações que é anômala como um todo, mesmo quando observações individuais não são anômalas por si mesmas - por exemplo, uma subsequência incomum em uma série temporal ou um padrão inesperado de atividade em uma rede de computadores.
A categoria apropriada depende em parte da estrutura dos dados. Métodos de anomalia pontual podem ser suficientes para observações independentes, enquanto séries temporais, dados espaciais, sequências e grafos frequentemente exigem que relações contextuais ou coletivas sejam modeladas explicitamente.
Termos relacionados
Os termos anomalia, valor atípico e novidade são às vezes usados de forma intercambiável, mas seu uso varia entre estatística, aprendizado de máquina, processamento de sinais e domínios de aplicação individuais. Um valor atípico comumente denota uma observação que parece inconsistente com outras observações em um conjunto de dados; métodos de detecção de valores atípicos frequentemente permitem que tais observações estejam presentes nos dados usados para ajustar o modelo. Na detecção de novidades, presume-se geralmente que os dados de treinamento representam comportamento normal, e observações de teste nunca antes vistas são avaliadas contra o modelo de normalidade resultante. A detecção de novidades é, consequentemente, frequentemente formulada como uma forma de classificação de uma classe. Essas distinções não são aplicadas de forma consistente em toda a literatura, e o termo mais amplo detecção de anomalias frequentemente inclui todos esses cenários.
Técnicas e categorias
Existem três grandes categorias de técnicas de detecção de anomalias. Técnicas de detecção de anomalias supervisionadas exigem um conjunto de dados rotulado como "normal" e "anormal" e envolvem o treinamento de um classificador. No entanto, essa abordagem raramente é usada porque dados rotulados geralmente não estão disponíveis e as classes são inerentemente desbalanceadas. Técnicas de detecção de anomalias semissupervisionadas assumem que alguma porção dos dados é rotulada - tipicamente dados normais - e constroem um modelo que representa o comportamento normal, testando então a probabilidade de uma instância de teste ter sido gerada pelo modelo. Técnicas de detecção de anomalias não supervisionadas assumem que os dados não são rotulados e são de longe as mais comumente usadas devido à sua aplicação mais ampla e relevante.
Métodos estatísticos
Abordagens estatísticas modelam o comportamento normal dos dados usando distribuições de probabilidade. Os métodos incluem técnicas paramétricas, como modelos de mistura gaussiana, e técnicas não paramétricas baseadas em histogramas ou estimativa de densidade por kernel. Observações com baixa probabilidade sob o modelo ajustado são sinalizadas como anomalias. Esses métodos frequentemente assumem independência entre as observações, tornando-os menos adequados para dados estruturados complexos sem adaptação.
Métodos baseados em distância e densidade
Métodos baseados em distância caracterizam uma observação como anômala se ela estiver longe de seus vizinhos mais próximos. Métodos baseados em densidade, como o fator de valor atípico local, comparam a densidade local ao redor de uma observação com a de seus vizinhos; observações em regiões de densidade significativamente menor são sinalizadas. Esses métodos são particularmente úteis para identificar anomalias pontuais em conjuntos de dados com densidades variáveis e não exigem suposições a priori sobre a distribuição dos dados.
Métodos baseados em clusterização
A detecção de anomalias baseada em clusterização agrupa dados em clusters e identifica anomalias como pontos que não pertencem a nenhum cluster, estão longe dos centroides dos clusters ou pertencem a clusters muito pequenos. Algoritmos como k-means e DBSCAN foram adaptados para esse fim. A abordagem é intuitiva e pode ser eficiente, mas o desempenho depende do algoritmo de clusterização escolhido e de seus parâmetros, e a definição do que constitui um cluster anômalo varia conforme a aplicação.
Abordagens de aprendizado de máquina e aprendizado profundo
A detecção moderna de anomalias depende cada vez mais de técnicas de aprendizado de máquina e aprendizado profundo. Autoencoders, um tipo de rede neural, aprendem a reconstruir dados normais; um alto erro de reconstrução indica uma anomalia. Máquinas de vetores de suporte de uma classe aprendem um limite ao redor de dados normais em um espaço de características de alta dimensão. Métodos baseados em arquiteturas transformer e modelos de linguagem de grande porte também foram explorados para detectar anomalias em dados sequenciais, como logs ou séries temporais, aproveitando sua capacidade de modelar dependências de longo alcance e padrões contextuais.
Aplicações
Segurança cibernética
A detecção de anomalias é um componente fundamental dos sistemas de detecção de intrusão. O conceito evoluiu significativamente ao longo do tempo, começando como um processo manual em que administradores de sistema monitoravam atividades incomuns, como o acesso à conta de um usuário em férias ou atividade inesperada de impressora. No final dos anos 1970 e início dos anos 1980, a análise de logs de auditoria e logs do sistema era principalmente retrospectiva para investigação de incidentes, pois o volume de dados tornava o monitoramento em tempo real impraticável. A acessibilidade do armazenamento digital permitiu a análise online de logs de auditoria com programas especializados, embora esses programas fossem tipicamente executados fora dos horários de pico devido à intensidade computacional. Os anos 1990 trouxeram sistemas de detecção de intrusão em tempo real capazes de analisar dados de auditoria à medida que eram gerados, mudando para detecção proativa. Sistemas modernos aplicam detecção de anomalias ao tráfego de rede, comportamento do usuário e atividades de endpoints para identificar ataques de dia zero, ameaças internas e outros padrões maliciosos.
Detecção de fraudes financeiras
Em finanças, a detecção de anomalias identifica transações fraudulentas, como fraude de cartão de crédito, abuso em reivindicações de seguros e lavagem de dinheiro. Padrões incomuns em valores de transação, frequência ou localização geográfica podem acionar alertas para investigação adicional. O campo se beneficia tanto de métodos supervisionados que usam rótulos históricos de fraude quanto de métodos não supervisionados para descobrir novos esquemas de fraude.
Medicina e saúde
Aplicações médicas incluem a detecção de sinais fisiológicos anormais, a identificação de respostas inesperadas a tratamentos e a sinalização de anomalias em imagens médicas, como ressonâncias magnéticas ou tomografias computadorizadas. Esses sistemas ajudam os clínicos a focar a atenção em casos que se desviam das normas estabelecidas, potencialmente melhorando o diagnóstico de condições raras ou a detecção precoce de mau funcionamento de equipamentos.
Manufatura e manutenção preditiva
Em ambientes industriais, a detecção de anomalias monitora leituras de sensores de equipamentos para prever falhas antes que ocorram. Padrões incomuns de vibração, picos de temperatura ou assinaturas acústicas podem indicar avarias iminentes, permitindo que equipes de manutenção intervenham proativamente. Isso reduz o tempo de inatividade e os custos de manutenção em setores como manufatura, aviação e energia.
Desafios e limitações
A detecção de anomalias enfrenta vários desafios persistentes. A definição de normalidade frequentemente muda ao longo do tempo, exigindo que os modelos se adaptem ao desvio de conceito. A raridade das anomalias torna os dados rotulados escassos, limitando abordagens supervisionadas e complicando a avaliação. Conjuntos de dados desbalanceados podem levar a altas taxas de falsos positivos, que são custosos em domínios como segurança cibernética, onde analistas devem triar inúmeros alertas. Além disso, as anomalias são dependentes do contexto, e métodos que funcionam bem em observações pontuais independentes podem falhar em dados estruturados, como grafos ou sequências, sem modelagem contextual explícita.
A escolha do limite de decisão é crítica; reduzi-lo aumenta a taxa de detecção, mas também eleva os falsos alarmes, enquanto aumentá-lo pode perder anomalias sutis. Não há uma métrica universalmente aceita para comparar métodos de detecção de anomalias entre domínios, pois os custos relativos de falsos positivos e falsos negativos variam significativamente conforme a aplicação.
Relação com outros campos
A detecção de anomalias se intersecta com várias áreas de inteligência artificial e estatística. Em IA generativa, modelos como transformers podem ser usados para estimar a probabilidade de sequências, fornecendo uma base para detectar entradas incomuns. Pesquisas em instituições como MIT CSAIL e Stanford AI Lab contribuíram para fundamentos teóricos e algoritmos práticos. Empresas como Amazon Web Services e Google Cloud oferecem serviços de detecção de anomalias como parte de suas plataformas de nuvem, integrando-se a pipelines de aprendizado de máquina. O campo também se baseia em trabalhos de análise de séries temporais, processamento de sinais e estatística robusta, e informa práticas em gerenciamento de qualidade de dados e monitoramento de sistemas.