In der Datenanalyse bezeichnet Anomalieerkennung die Identifizierung seltener Elemente, Ereignisse oder Beobachtungen, die erheblich von der Mehrheit der Daten abweichen und nicht einem klar definierten Konzept normalen Verhaltens entsprechen. Solche Beispiele können den Verdacht erwecken, von einem anderen Mechanismus erzeugt worden zu sein, oder inkonsistent mit dem Rest des Datensatzes erscheinen. Das Konzept wird auch als Ausreißererkennung und manchmal, abhängig vom Kontext und Anwendungsbereich, als Neuheitserkennung bezeichnet.
Anomalieerkennung findet Anwendung in zahlreichen Bereichen, darunter Cybersicherheit, Medizin, maschinelles Sehen, Statistik, Neurowissenschaften, Strafverfolgung und Erkennung von Finanzbetrug. Historisch wurden Anomalien zunächst zur klaren Ablehnung oder Auslassung aus Daten gesucht, um statistische Analysen wie die Berechnung von Mittelwert oder Standardabweichung zu unterstützen. Sie wurden auch entfernt, um Vorhersagen aus Modellen wie der linearen Regression zu verbessern, und in jüngerer Zeit unterstützt ihre Entfernung die Leistung von Algorithmen des maschinellen Lernens. In vielen Anwendungen sind Anomalien jedoch selbst von primärem Interesse und die am meisten gewünschten Beobachtungen im gesamten Datensatz, die identifiziert und von Rauschen oder irrelevanten Ausreißern getrennt werden müssen.
Definition und Terminologie
Anomalieerkennung ist die Identifizierung von Beobachtungen, Ereignissen oder Mustern, die in einer bestimmten Umgebung erheblich vom erwarteten normalen Verhalten abweichen. Es gibt keine einzige operative Definition, die universell über alle Bereiche hinweg anwendbar ist, da das Konzept der Normalität von den Daten, der Darstellung der Beobachtungen, dem Kontext, in dem sie auftreten, und den Annahmen abhängt, die von der Erkennungsmethode gemacht werden.
Eine Anomalie ist nicht unbedingt ein Datenfehler. Je nach Anwendung kann sie einen Mess- oder Aufzeichnungsfehler, eine Änderung im Prozess, der die Daten erzeugt hat, eine ungewöhnliche, aber gültige Beobachtung oder ein Ereignis von Interesse wie Betrug, Geräteausfall oder einen Sicherheitseinbruch darstellen. Anomalien sind auch nicht allein durch Seltenheit oder Distanz zu anderen Beobachtungen definiert; verschiedene Methoden charakterisieren Normalität mithilfe von Wahrscheinlichkeitsverteilungen, Distanzen oder lokalen Dichten, Clusterzugehörigkeit, Grenzen um normale Daten, Vorhersagefehlern, Rekonstruktionsfehlern oder anderen modellspezifischen Kriterien.
Viele Anomalieerkennungsmethoden geben einen numerischen Anomalie-Score zurück, anstatt ein sofortiges kategoriales Label. Der Score repräsentiert das Ausmaß, in dem eine Beobachtung vom angepassten Modell der Normalität abweicht, und wird durch Anwendung eines Entscheidungsschwellenwerts in eine binäre Entscheidung umgewandelt. Folglich hängt es vom Modell der Normalität, dem verfügbaren Kontext und der verwendeten Entscheidungsregel ab, ob eine Beobachtung als anomal gekennzeichnet wird.
Arten von Anomalien
Eine weit verbreitete Klassifikation unterscheidet drei Arten von Anomalien. Eine Punktanomalie ist eine einzelne Beobachtung, die relativ zum Rest der Daten als anomal angesehen wird - zum Beispiel eine ungewöhnlich große Transaktion im Vergleich zu anderen Transaktionen in einem Datensatz. Eine kontextuelle Anomalie, auch bedingte Anomalie genannt, ist nur innerhalb eines bestimmten Kontexts anomal - eine Beobachtung kann unter einem Satz von Umständen normal, unter einem anderen jedoch anomal sein, wie eine Temperatur, die im Sommer normal, im Winter jedoch ungewöhnlich ist. Der Kontext kann zeitlich, räumlich, demografisch oder anderweitig durch die Anwendung definiert sein. Eine kollektive Anomalie ist eine zusammenhängende Sammlung von Beobachtungen, die als Ganzes anomal ist, auch wenn einzelne Beobachtungen für sich genommen nicht anomal sind - zum Beispiel eine ungewöhnliche Teilsequenz in einer Zeitreihe oder ein unerwartetes Aktivitätsmuster in einem Computernetzwerk.
Die angemessene Kategorie hängt teilweise von der Struktur der Daten ab. Punktanomalie-Methoden können für unabhängige Beobachtungen ausreichen, während Zeitreihen, räumliche Daten, Sequenzen und Graphen oft erfordern, dass kontextuelle oder kollektive Beziehungen explizit modelliert werden.
Verwandte Begriffe
Die Begriffe Anomalie, Ausreißer und Neuheit werden manchmal synonym verwendet, aber ihre Verwendung variiert zwischen Statistik, maschinellem Lernen, Signalverarbeitung und einzelnen Anwendungsbereichen. Ein Ausreißer bezeichnet üblicherweise eine Beobachtung, die inkonsistent mit anderen Beobachtungen in einem Datensatz erscheint; Ausreißererkennungsmethoden erlauben oft, dass solche Beobachtungen in den Daten vorhanden sind, die zum Anpassen des Modells verwendet werden. Bei der Neuheitserkennung wird allgemein angenommen, dass die Trainingsdaten normales Verhalten repräsentieren, und zuvor ungesehene Testbeobachtungen werden gegen das resultierende Modell der Normalität bewertet. Neuheitserkennung wird folglich oft als eine Form der Ein-Klassen-Klassifikation formuliert. Diese Unterscheidungen werden in der Literatur nicht konsistent angewendet, und der breitere Begriff Anomalieerkennung umfasst häufig alle diese Einstellungen.
Techniken und Kategorien
Es gibt drei breite Kategorien von Anomalieerkennungstechniken. Überwachte Anomalieerkennungstechniken erfordern einen Datensatz, der als "normal" und "abnormal" gekennzeichnet ist, und beinhalten das Training eines Klassifikators. Dieser Ansatz wird jedoch selten verwendet, da gekennzeichnete Daten im Allgemeinen nicht verfügbar sind und die Klassen von Natur aus unausgewogen sind. Semi-überwachte Anomalieerkennungstechniken nehmen an, dass ein Teil der Daten gekennzeichnet ist - typischerweise normale Daten - und konstruieren ein Modell, das normales Verhalten repräsentiert, und testen dann die Wahrscheinlichkeit, dass eine Testinstanz vom Modell erzeugt wurde. Unüberwachte Anomalieerkennungstechniken nehmen an, dass die Daten ungekennzeichnet sind, und sind bei weitem die am häufigsten verwendeten, aufgrund ihrer breiteren und relevanteren Anwendung.
Statistische Methoden
Statistische Ansätze modellieren das normale Verhalten von Daten mithilfe von Wahrscheinlichkeitsverteilungen. Methoden umfassen parametrische Techniken wie Gaußsche Mischmodelle und nicht-parametrische Techniken, die auf Histogrammen oder Kernel-Dichteschätzung basieren. Beobachtungen mit geringer Wahrscheinlichkeit unter dem angepassten Modell werden als Anomalien gekennzeichnet. Diese Methoden nehmen oft Unabhängigkeit zwischen Beobachtungen an:anomalien, was sie ohne Anpassung weniger geeignet für komplexe strukturierte Daten macht.
Distanzbasierte und dichtebasierte Methoden
Distanzbasierte Methoden charakterisieren eine Beobachtung als anomal, wenn sie weit von ihren nächsten Nachbarn entfernt ist. Dichtebasierte Methoden wie der lokale Ausreißerfaktor vergleichen die lokale Dichte um eine Beobachtung mit der ihrer Nachbarn; Beobachtungen in Regionen mit signifikant geringerer Dichte werden gekennzeichnet. Diese Methoden sind besonders nützlich zur Identifizierung von Punktanomalien in Datensätzen mit variierenden Dichten und erfordern keine a priori Annahmen über die Datenverteilung.
Clusterbasierte Methoden
Clusterbasierte Anomalieerkennung gruppiert Daten in Cluster und identifiziert Anomalien als Punkte, die zu keinem Cluster gehören, weit von Clusterzentroiden entfernt sind oder zu sehr kleinen Clustern gehören. Algorithmen wie k-Means und DBSCAN wurden für diesen Zweck angepasst. Der Ansatz ist intuitiv und kann effizient sein, aber die Leistung hängt vom gewählten Clustering-Algorithmus und seinen Parametern ab, und die Definition dessen, was ein anomales Cluster ausmacht, variiert je nach Anwendung.
Ansätze des maschinellen Lernens und des Deep Learning
Moderne Anomalieerkennung stützt sich zunehmend auf maschinelles Lernen und Deep-Learning-Techniken. Autoencoder, eine Art von neuronalen Netzen, lernen, normale Daten zu rekonstruieren; ein hoher Rekonstruktionsfehler weist auf eine Anomalie hin. Ein-Klassen-Support-Vektor-Maschinen lernen eine Grenze um normale Daten in einem hochdimensionalen Merkmalsraum. Methoden, die auf Transformer-Architekturen und großen Sprachmodellen basieren, wurden auch zur Erkennung von Anomalien in sequenziellen Daten wie Protokollen oder Zeitreihen untersucht, wobei sie ihre Fähigkeit nutzen, langreichweitige Abhängigkeiten und kontextuelle Muster zu modellieren.
Anwendungen
Cybersicherheit
Anomalieerkennung ist eine grundlegende Komponente von Intrusion-Detection-Systemen. Das Konzept entwickelte sich im Laufe der Zeit erheblich weiter, beginnend als manueller Prozess, bei dem Systemadministratoren auf ungewöhnliche Aktivitäten überwachten, wie den Zugriff auf das Konto eines urlaubenden Benutzers oder unerwartete Druckeraktivität. In den späten 1970er und frühen 1980er Jahren war die Analyse von Audit-Protokollen und Systemprotokollen hauptsächlich retrospektiv für die Untersuchung von Vorfällen, da die Datenmenge eine Echtzeitüberwachung unpraktisch machte. Die Erschwinglichkeit digitaler Speicherung ermöglichte die Online-Analyse von Audit-Protokollen mit speziellen Programmen, obwohl diese Programme aufgrund der Rechenintensität typischerweise außerhalb der Hauptgeschäftszeiten ausgeführt wurden. In den 1990er Jahren kamen Echtzeit-Intrusion-Detection-Systeme auf, die in der Lage waren, Audit-Daten zu analysieren, während sie erzeugt wurden, und wechselten zur proaktiven Erkennung. Moderne Systeme wenden Anomalieerkennung auf Netzwerkverkehr, Benutzerverhalten und Endpunktaktivitäten an, um Zero-Day-Angriffe, Insider-Bedrohungen und andere bösartige Muster zu identifizieren.
Erkennung von Finanzbetrug
Im Finanzwesen identifiziert Anomalieerkennung betrügerische Transaktionen wie Kreditkartenbetrug, Missbrauch von Versicherungsansprüchen und Geldwäsche. Ungewöhnliche Muster bei Transaktionsbeträgen, -häufigkeit oder -standort können Warnungen für weitere Untersuchungen auslösen. Das Feld profitiert sowohl von überwachten Methoden, die historische Betrugslabels verwenden, als auch von unüberwachten Methoden zur Entdeckung neuartiger Betrugsschemata.
Medizin und Gesundheitswesen
Medizinische Anwendungen umfassen die Erkennung abnormaler physiologischer Signale, die Identifizierung unerwarteter Reaktionen auf Behandlungen und die Kennzeichnung von Anomalien in medizinischen Bildern wie MRT- oder CT-Scans. Diese Systeme helfen Klinikern, die Aufmerksamkeit auf Fälle zu richten, die von etablierten Normen abweichen, und verbessern möglicherweise die Diagnose seltener Erkrankungen oder die frühzeitige Erkennung von Gerätefehlfunktionen.
Fertigung und vorausschauende Wartung
In industriellen Umgebungen überwacht Anomalieerkennung Sensorwerte von Geräten und sagt Ausfälle vorher, bevor sie auftreten. Ungewöhnliche Vibrationsmuster, Temperaturspitzen oder akustische Signaturen können bevorstehende Ausfälle anzeigen und ermöglichen es Wartungsteams, proaktiv einzugreifen. Dies reduziert Ausfallzeiten und Wartungskosten in Sektoren wie Fertigung, Luftfahrt und Energie.
Herausforderungen und Einschränkungen
Anomalieerkennung steht vor mehreren anhaltenden Herausforderungen. Die Definition von Normalität ändert sich oft im Laufe der Zeit, was erfordert, dass Modelle sich an Konzeptdrift anpassen. Die Seltenheit von Anomalien macht gekennzeichnete Daten knapp, was überwachte Ansätze einschränkt und die Bewertung erschwert. Unausgewogene Datensätze können zu hohen Falsch-Positiv-Raten führen, die in Bereichen wie Cybersicherheit kostspielig sind, wo Analysten zahlreiche Warnungen priorisieren müssen. Darüber hinaus sind Anomalien kontextabhängig, und Methoden, die bei unabhängigen Punktbeobachtungen gut funktionieren, können bei strukturierten Daten wie Graphen oder Sequenzen ohne explizite kontextuelle Modellierung versagen.
Die Wahl des Entscheidungsschwellenwerts ist entscheidend; eine Senkung erhöht die Erkennungsrate, führt aber auch zu mehr Fehlalarmen, während eine Erhöhung subtile Anomalien übersehen kann. Es gibt keine allgemein akzeptierte Metrik zum Vergleich von Anomalieerkennungsmethoden über Bereiche hinweg, da die relativen Kosten von Falsch-Positiven und Falsch-Negativen je nach Anwendung erheblich variieren.
Beziehung zu anderen Bereichen
Anomalieerkennung überschneidet sich mit mehreren Bereichen der künstlichen Intelligenz und Statistik. In generativer KI können Modelle wie Transformer verwendet werden, um die Wahrscheinlichkeit von Sequenzen zu schätzen, was eine Grundlage für die Erkennung ungewöhnlicher Eingaben bietet. Forschung an Institutionen wie MIT CSAIL und Stanford AI Lab hat zu theoretischen Grundlagen und praktischen Algorithmen beigetragen. Unternehmen wie Amazon Web Services und Google Cloud bieten Anomalieerkennungsdienste als Teil ihrer Cloud-Plattformen an und integrieren sie in Machine-Learning-Pipelines. Das Feld stützt sich auch auf Arbeiten in Zeitreihenanalyse, Signalverarbeitung und robuster Statistik und informiert Praktiken im Datenqualitätsmanagement und in der Systemüberwachung.