나이브 베이즈 분류기는 베이즈 정리에 기반하여 문제 인스턴스에 클래스 레이블을 할당하는 확률적 분류기 계열이다. 나이브 독립성 가정으로 알려진 핵심 가정은 각 특성이 목표 클래스가 주어졌을 때 클래스의 확률에 독립적으로 기여한다는 것이다. 이는 모델이 예측 변수 간에 공유되는 정보가 없다고 가정함을 의미하며, 이는 분류기에 이름을 부여한 비현실적인 단순화이다. 그럼에도 불구하고 나이브 베이즈 모델은 가장 단순한 베이즈 네트워크 모델 중 일부이며 많은 실제 시나리오에서 효과적임이 입증되었다.
이 분류기는 기계 학습 및 인공 지능 분야에서 텍스트 분류, 스팸 필터링, 의료 진단과 같은 작업에 널리 사용된다. 특히 특성당 하나의 매개변수만 필요로 하는 확장성과 적은 양의 훈련 데이터로도 잘 작동하는 능력으로 높이 평가된다. 최대 우도 훈련은 각 그룹의 관측치를 세어 닫힌 형태의 식을 평가하는 것을 포함하며, 대부분의 다른 모델이 사용하는 비용이 많이 드는 반복 근사 알고리즘을 피한다.
역사적 발전
나이브 베이즈 분류기는 초기 통계 연구에 뿌리를 두고 있으며, 그 원리는 토머스 베이즈의 연구를 통해 18세기로 거슬러 올라간다. 현대적 공식은 컴퓨팅 능력이 성장하면서 20세기 중반에 등장했다. 1960년대에는 제록스 팔로알토 연구소 및 MIT 컴퓨터 과학 및 인공 지능 연구소와 같은 기관의 연구자들이 패턴 인식에 대한 확률적 접근 방식을 탐구하기 시작했다. 이 분류기는 1990년대에 기계 학습이 독자적인 분야로 부상하면서, 특히 텍스트 범주화와 정보 검색 응용을 통해 두각을 나타냈다.
2004년에는 베이즈 분류 문제에 대한 분석이 나이브 가정에도 불구하고 분류기의 명백한 효용성에 대한 건전한 이론적 근거를 제공하면서 중요한 이론적 이정표가 세워졌다. 그러나 2006년의 포괄적인 비교는 나이브 베이즈가 부스팅 트리나 랜덤 포레스트와 같은 다른 접근 방식, 특히 정확도와 불확실성 정량화 측면에서 종종 성능이 뒤처진다는 것을 보여주었다.
확률적 모델
추상적으로 나이브 베이즈는 n개의 특성을 인코딩하는 벡터 x = (x_1, ..., x_n)로 표현되는 문제 인스턴스가 주어졌을 때 K개의 가능한 클래스 C_k 각각에 대해 확률 p(C_k | x_1, ..., x_n)을 할당하는 조건부 확률 모델이다. 베이즈 정리를 사용하면 조건부 확률은 사후 확률 = (사전 확률 × 우도) / 증거로 분해될 수 있다. 실제로는 분모가 클래스에 의존하지 않고 특성 값이 주어지므로 분자만 관심 대상이다.
분자는 결합 확률 모델 p(C_k, x_1, ..., x_n)과 동일하며, 연쇄 법칙을 사용하여 다시 쓸 수 있다. 나이브 가정은 클래스가 주어졌을 때 특성을 조건부 독립으로 취급하여 이를 단순화하며, 결합 확률을 개별 특성 확률의 곱으로 표현할 수 있게 한다. 이 단순화는 많은 특성이나 많은 값을 가진 특성이 있더라도 모델을 다루기 쉽게 만든다.
결정 규칙에 베이즈 정리를 사용함에도 불구하고 나이브 베이즈는 반드시 베이즈 방법은 아니다. 모델은 베이즈 또는 빈도주의 방법 중 하나로 적합시킬 수 있으며, 매개변수 추정은 일반적으로 단순한 관측치 계산을 포함하는 최대 우도를 사용한다.
훈련 및 추정
나이브 베이즈 분류기를 훈련하는 것은 각 클래스의 사전 확률과 각 클래스가 주어졌을 때 각 특성의 조건부 확률을 추정하는 것을 포함한다. 최대 우도 훈련의 경우 이러한 매개변수는 훈련 데이터에서 발생 횟수를 세어 직접 계산된다. 예를 들어, 클래스의 사전 확률은 해당 클래스에 속하는 훈련 인스턴스의 비율이고, 클래스가 주어졌을 때 특성 값의 조건부 확률은 해당 특성 값을 가진 해당 클래스의 인스턴스 비율이다.
이 닫힌 형태의 추정은 계산적으로 효율적이며 데이터에 대한 단일 패스만 필요하므로 나이브 베이즈를 대규모 데이터 세트에 매우 확장 가능하게 만든다. 라플라스 평활화와 같은 평활화 기법은 보이지 않는 특성-클래스 조합에 대한 영확률을 피하기 위해 자주 적용된다. 훈련의 단순성은 반복 최적화 알고리즘을 요구하는 신경망 또는 심층 학습 접근 방식과 같은 더 복잡한 모델과 대조된다.
응용 및 한계
나이브 베이즈 분류기는 다양한 분야에서 성공적으로 적용되었다. 자연어 처리에서는 문서 분류, 감정 분석, 스팸 필터링에 사용된다. 의료 분야에서는 바바 원자력 연구 센터 및 노키아 벨 연구소에서 개발된 것과 같은 진단 시스템을 지원한다. 분류기의 효율성은 아마존 웹 서비스 및 구글 클라우드 플랫폼을 포함한 실시간 응용에 적합하게 만든다.
그러나 나이브 베이즈 모델은 일반적으로 로지스틱 회귀와 같은 더 고급 모델보다 성능이 낮으며, 특히 불확실성을 정량화할 때 과신하는 확률을 생성하는 경우가 많다. 독립성 가정은 특성이 상관되어 있을 때 최적이 아닌 성능으로 이어질 수 있다. 이러한 한계에도 불구하고 분류기는 여전히 가치 있는 기준선으로 남아 있으며 기계 학습 연구에서 벤치마크로 자주 사용된다.
이론적 근거
비현실적인 가정에도 불구하고 나이브 베이즈의 효과성이라는 명백한 역설은 광범위하게 연구되었다. 연구는 분류기의 결정 경계가 독립성 가정이 위반된 경우에도 최적일 수 있음을 보여주었으며, 특히 특성 간의 의존성이 상쇄되는 경우에 그렇다. 이러한 이론적 견고성은 계산 효율성과 결합되어 실제 사용에서의 지속적인 사용을 설명한다.
2020년대 현재 나이브 베이즈는 기계 학습 과정에서 가르쳐지고 주요 라이브러리에 구현된 기본 기술로 남아 있다. 그 원리는 또한 생성형 AI 및 대규모 언어 모델 연구에서 더 고급 확률적 모델의 기초가 되며, 조건부 독립 가정이 복잡한 확률 분포를 단순화하는 데 때때로 사용된다.