데이터 분석에서 이상 탐지는 대부분의 데이터에서 크게 벗어나 정상적인 행동에 대한 명확한 정의에 부합하지 않는 드문 항목, 사건 또는 관측치를 식별하는 것을 말한다. 이러한 예는 다른 메커니즘에 의해 생성되었을 가능성을 의심하게 하거나 데이터 세트의 나머지 부분과 일치하지 않는 것으로 보일 수 있다. 이 개념은 이상치 탐지라고도 하며, 상황과 응용 분야에 따라 신규성 탐지라고도 한다.
이상 탐지는 사이버 보안, 의학, 머신 비전, 통계, 신경 과학, 법 집행 및 금융 사기 탐지를 포함한 다양한 분야에서 응용된다. 역사적으로 이상치는 평균이나 표준 편차 계산과 같은 통계 분석을 돕기 위해 데이터에서 명확히 제외하거나 생략하기 위해 처음으로 찾았다. 또한 선형 회귀와 같은 모델의 예측을 개선하기 위해 제거되었으며, 최근에는 머신 러닝 알고리즘의 성능을 향상시키기 위해 제거되기도 한다. 그러나 많은 응용 분야에서 이상치 자체가 주요 관심사이며 데이터 세트 전체에서 가장 원하는 관측치로, 노이즈나 관련 없는 이상치와 구별하여 식별하고 분리해야 한다.
정의 및 용어
이상 탐지는 특정 설정에서 예상되는 정상적인 행동에서 크게 벗어나는 관측치, 사건 또는 패턴을 식별하는 것이다. 정상성의 개념은 데이터, 관측치의 표현, 발생 맥락 및 탐지 방법이 만든 가정에 따라 달라지므로 모든 분야에 보편적으로 적용되는 단일 운영 정의는 없다.
이상치는 반드시 데이터 오류는 아니다. 응용 분야에 따라 측정 또는 기록 오류, 데이터를 생성한 프로세스의 변경, 드물지만 유효한 관측치, 또는 사기, 장비 고장, 보안 침입과 같은 관심 사건을 나타낼 수 있다. 이상치는 또한 단순히 희귀성이나 다른 관측치와의 거리로만 정의되지 않는다. 다양한 방법은 확률 분포, 거리 또는 로컬 밀도, 클러스터 소속, 정상 데이터 주변의 경계, 예측 오류, 재구성 오류 또는 기타 모델별 기준을 사용하여 정상성을 특성화한다.
많은 이상 탐지 방법은 즉각적인 범주형 레이블 대신 숫자 이상 점수를 반환한다. 점수는 관측치가 적합된 정상성 모델에서 벗어난 정도를 나타내며, 결정 임계값을 적용하여 이진 결정으로 변환된다. 결과적으로 관측치가 이상으로 레이블링되는지 여부는 정상성 모델, 사용 가능한 맥락 및 사용된 결정 규칙에 따라 달라진다.
이상치 유형
널리 사용되는 분류는 세 가지 유형의 이상치를 구분한다. 점 이상치는 데이터의 나머지 부분과 비교하여 비정상적인 개별 관측치이다 - 예를 들어, 데이터 세트의 다른 거래와 비교하여 비정상적으로 큰 거래. 맥락 이상치는 특정 맥락에서만 비정상적인 것으로, 조건부 이상치라고도 한다 - 관측치는 한 상황에서는 정상일 수 있지만 다른 상황에서는 비정상일 수 있다, 예를 들어 여름에는 정상이지만 겨울에는 비정상적인 온도. 맥락은 시간적, 공간적, 인구통계학적 또는 응용 분야에 의해 정의될 수 있다. 집단 이상치는 개별 관측치 자체가 비정상적이지 않더라도 전체적으로 비정상적인 관련 관측치 집합이다 - 예를 들어, 시계열의 비정상적인 하위 시퀀스 또는 컴퓨터 네트워크의 예상치 못한 활동 패턴.
적절한 범주는 부분적으로 데이터 구조에 따라 달라진다. 점 이상치 방법은 독립적인 관측치에 충분할 수 있지만, 시계열, 공간 데이터, 시퀀스 및 그래프는 종종 맥락적 또는 집단적 관계를 명시적으로 모델링해야 한다.
관련 용어
이상치, 이상치 및 신규성이라는 용어는 때때로 서로 바꿔 사용되지만, 통계, Machine learning, 신호 처리 및 개별 응용 분야에 따라 사용이 다르다. 이상치는 일반적으로 데이터 세트의 다른 관측치와 일치하지 않는 관측치를 나타내며, 이상치 탐지 방법은 종종 모델을 적합하는 데 사용되는 데이터에 이러한 관측치가 존재하도록 허용한다. 신규성 탐지에서는 훈련 데이터가 일반적으로 정상적인 행동을 나타낸다고 가정하며, 이전에 보지 못한 테스트 관측치는 결과 정상성 모델에 대해 평가된다. 따라서 신규성 탐지는 종종 일종의 일대일 분류로 공식화된다. 이러한 구분은 문헌 전체에서 일관되게 적용되지 않으며, 더 넓은 용어인 이상 탐지는 종종 이러한 모든 설정을 포함한다.
기술 및 범주
세 가지 광범위한 범주의 이상 탐지 기술이 존재한다. 지도 이상 탐지 기술은 "정상" 및 "비정상"으로 레이블링된 데이터 세트를 필요로 하며 분류기를 훈련하는 것을 포함한다. 그러나 레이블링된 데이터가 일반적으로 사용 불가능하고 클래스가 본질적으로 불균형하기 때문에 이 접근 방식은 거의 사용되지 않는다. 반지도 이상 탐지 기술은 데이터의 일부가 레이블링되어 있다고 가정하며 - 일반적으로 정상 데이터 - 정상적인 행동을 나타내는 모델을 구성한 다음 테스트 인스턴스가 모델에 의해 생성되었을 가능성을 테스트한다. 비지도 이상 탐지 기술은 데이터가 레이블링되지 않았다고 가정하며, 더 넓고 관련성 있는 응용으로 인해 가장 일반적으로 사용된다.
통계적 방법
통계적 접근 방식은 확률 분포를 사용하여 데이터의 정상적인 행동을 모델링한다. 방법에는 가우시안 혼합 모델과 같은 모수적 기법과 히스토그램 또는 커널 밀도 추정에 기반한 비모수적 기법이 포함된다. 적합된 모델에서 낮은 확률을 가진 관측치는 이상치로 플래그 지정된다. 이러한 방법은 종종 관측치 간의 독립성을 가정하므로, 적응 없이 복잡한 구조화된 데이터에는 덜 적합하다.
거리 기반 및 밀도 기반 방법
거리 기반 방법은 관측치가 가장 가까운 이웃에서 멀리 떨어져 있으면 비정상적인 것으로 특성화한다. 로컬 이상치 요인과 같은 밀도 기반 방법은 관측치 주변의 로컬 밀도를 이웃의 밀도와 비교하며, 밀도가 크게 낮은 영역의 관측치가 플래그 지정된다. 이러한 방법은 다양한 밀도를 가진 데이터 세트에서 점 이상치를 식별하는 데 특히 유용하며 데이터 분포에 대한 사전 가정이 필요하지 않다.
클러스터링 기반 방법
클러스터링 기반 이상 탐지는 데이터를 클러스터로 그룹화하고 어떤 클러스터에도 속하지 않거나, 클러스터 중심에서 멀리 떨어져 있거나, 매우 작은 클러스터에 속하는 점을 이상치로 식별한다. k-means 및 DBSCAN과 같은 알고리즘이 이 목적에 맞게 조정되었다. 이 접근 방식은 직관적이고 효율적일 수 있지만, 성능은 선택된 클러스터링 알고리즘과 해당 매개변수에 따라 달라지며, 비정상적인 클러스터를 구성하는 것의 정의는 응용 분야에 따라 다르다.
머신 러닝 및 딥 러닝 접근 방식
현대 이상 탐지는 점점 더 머신 러닝 및 딥 러닝 기술에 의존한다. 오토인코더는 신경망의 한 유형으로, 정상 데이터를 재구성하는 방법을 학습하며, 높은 재구성 오류는 이상치를 나타낸다. 일대일 서포트 벡터 머신은 고차원 특징 공간에서 정상 데이터 주변의 경계를 학습한다. 트랜스포머 아키텍처 및 대규모 언어 모델에 기반한 방법은 로그 또는 시계열과 같은 순차 데이터의 이상치를 탐지하기 위해 탐구되었으며, 장거리 의존성과 맥락적 패턴을 모델링하는 능력을 활용한다.
응용 분야
사이버 보안
이상 탐지는 침입 탐지 시스템의 기본 구성 요소이다. 이 개념은 시간이 지남에 따라 크게 발전했으며, 처음에는 시스템 관리자가 휴가 중인 사용자의 계정 접근이나 예상치 못한 프린터 활동과 같은 비정상적인 활동을 모니터링하는 수동 프로세스로 시작되었다. 1970년대 후반과 1980년대 초반에는 감사 로그 및 시스템 로그 분석이 주로 사고 조사를 위한 사후 분석이었으며, 데이터 양으로 인해 실시간 모니터링이 비실용적이었다. 디지털 저장 장치의 저렴함으로 인해 특수 프로그램을 사용한 감사 로그의 온라인 분석이 가능해졌지만, 이러한 프로그램은 계산 집약성 때문에 일반적으로 비수요 시간에 실행되었다. 1990년대에는 생성되는 감사 데이터를 실시간으로 분석할 수 있는 실시간 침입 탐지 시스템이 등장하여 사전 예방적 탐지로 전환되었다. 현대 시스템은 네트워크 트래픽, 사용자 행동 및 엔드포인트 활동에 이상 탐지를 적용하여 제로데이 공격, 내부자 위협 및 기타 악성 패턴을 식별한다.
금융 사기 탐지
금융 분야에서 이상 탐지는 신용 카드 사기, 보험 청구 남용 및 자금 세탁과 같은 사기 거래를 식별한다. 거래 금액, 빈도 또는 지리적 위치의 비정상적인 패턴은 추가 조사를 위한 알림을 트리거할 수 있다. 이 분야는 과거 사기 레이블을 사용한 지도 방법과 새로운 사기 계획을 발견하기 위한 비지도 방법 모두의 이점을 얻는다.
의학 및 의료
의료 응용 분야에는 비정상적인 생리 신호 탐지, 치료에 대한 예상치 못한 반응 식별, MRI 또는 CT 스캔과 같은 의료 이미지의 이상치 플래그 지정이 포함된다. 이러한 시스템은 임상의가 확립된 표준에서 벗어난 사례에 주의를 집중하도록 도와 희귀 질환 진단 또는 장비 오작동의 조기 발견을 개선할 수 있다.
제조 및 예측 유지보수
산업 환경에서 이상 탐지는 장비의 센서 판독값을 모니터링하여 고장이 발생하기 전에 예측한다. 비정상적인 진동 패턴, 온도 급증 또는 음향 신호는 임박한 고장을 나타낼 수 있으며, 유지보수 팀이 사전에 개입할 수 있게 한다. 이는 제조, 항공 및 에너지와 같은 분야에서 가동 중지 시간과 유지보수 비용을 줄인다.
과제 및 한계
이상 탐지는 몇 가지 지속적인 과제에 직면한다. 정상성의 정의는 종종 시간이 지남에 따라 변하므로 모델이 개념 드리프트에 적응해야 한다. 이상치의 희귀성은 레이블링된 데이터를 부족하게 만들어 지도 접근 방식을 제한하고 평가를 복잡하게 한다. 불균형 데이터 세트는 높은 오탐률로 이어질 수 있으며, 이는 분석가가 수많은 알림을 분류해야 하는 사이버 보안과 같은 분야에서 비용이 많이 든다. 또한 이상치는 맥락에 따라 달라지며, 독립적인 점 관측치에서 잘 작동하는 방법은 명시적인 맥락 모델링 없이 그래프나 시퀀스와 같은 구조화된 데이터에서는 실패할 수 있다.
결정 임계값의 선택은 중요하다. 낮추면 탐지율이 증가하지만 오탐도 증가하며, 높이면 미묘한 이상치를 놓칠 수 있다. 이상 탐지 방법을 분야 간에 비교하기 위한 보편적으로 인정된 지표는 없으며, 오탐과 미탐의 상대적 비용은 응용 분야에 따라 크게 다르다.
다른 분야와의 관계
이상 탐지는 인공 지능 및 통계의 여러 영역과 교차한다. 생성형 AI에서 트랜스포머와 같은 모델은 시퀀스의 가능성을 추정하는 데 사용될 수 있으며, 비정상적인 입력을 탐지하는 기반을 제공한다. MIT CSAIL 및 스탠포드 AI 랩과 같은 기관의 연구는 이론적 기반과 실용적인 알고리즘에 기여했다. 아마존 웹 서비스 및 구글 클라우드와 같은 회사는 클라우드 플랫폼의 일부로 이상 탐지 서비스를 제공하며, 머신 러닝 파이프라인과 통합된다. 이 분야는 또한 시계열 분석, 신호 처리 및 강건한 통계의 작업을 활용하며, 데이터 품질 관리 및 시스템 모니터링 관행에 정보를 제공한다.