이진 분류는 Machine learning에서 알고리즘이 각 입력 인스턴스를 두 개의 상호 배타적인 범주 중 하나에 할당하는 방법을 학습하는 기본적인 작업이다. 이러한 범주는 일반적으로 양성과 음성, 또는 0과 1로 표시되며, 스팸 대 비스팸 이메일, 질병 존재 대 부재, 고객 이탈 대 유지와 같은 결과를 나타낸다. 목표는 레이블이 지정된 훈련 데이터에서 새롭고 보지 못한 인스턴스를 정확하게 분류할 수 있는 예측 모델을 구축하는 것이다. 이는 클래스 수가 정확히 두 개인 다중 클래스 분류의 특정 사례로, 많은 실제 의사 결정 시스템의 기초를 형성한다.
이 과정은 각 예제에 알려진 이진 레이블이 있는 데이터 세트에서 모델을 훈련하는 것을 포함한다. 모델은 특징 공간에서 두 클래스를 분리하는 결정 경계를 학습한다. 이 경계는 로지스틱 회귀 또는 선형 커널을 사용하는 서포트 벡터 머신에서와 같이 선형일 수 있으며, 결정 트리, 랜덤 포레스트 또는 Neural network에서와 같이 비선형일 수 있다. 알고리즘 선택은 데이터의 특성, 특징과 레이블 간의 관계 복잡성, 계산 제약 조건에 따라 달라진다. 평가는 일반적으로 정확도, 정밀도, 재현율, F1 점수, 수신자 조작 특성 곡선 아래 면적(AUC-ROC)과 같은 지표를 사용하며, 각 지표는 특히 클래스가 불균형할 때 모델 성능에 대한 다양한 통찰력을 제공한다.
핵심 개념 및 용어
이진 분류는 명확한 프레임워크 하에서 작동한다. 양성 클래스는 종종 사기 거래와 같은 관심 사건이며, 음성 클래스는 정상적인 경우이다. 예측은 네 가지 결과로 분류된다: 참 양성(양성으로 올바르게 예측), 참 음성(음성으로 올바르게 예측), 거짓 양성(양성으로 잘못 예측, 제1종 오류라고도 함), 거짓 음성(음성으로 잘못 예측, 제2종 오류). 이러한 결과는 모든 평가 지표를 구동한다. 예를 들어, 정밀도는 양성으로 예측된 것 중 올바른 비율을 측정하는 반면, 재현율(민감도)은 실제 양성 중 올바르게 식별된 비율을 측정한다. 정밀도와 재현율 간의 균형은 인스턴스가 양성으로 레이블되는 확률 컷오프인 분류 임계값을 조정하여 관리되는 경우가 많다.
일반적인 알고리즘 및 기법
여러 알고리즘이 이진 분류에 널리 사용된다. 로지스틱 회귀는 로지스틱 함수를 사용하여 양성 클래스의 확률을 모델링하는 고전적인 통계 방법으로, 해석 가능한 계수를 제공한다. 서포트 벡터 머신은 클래스 간의 마진을 최대화하는 초평면을 찾으며, 고차원 공간에서 효과적이다. 결정 트리와 랜덤 포레스트 및 그래디언트 부스팅(예: XGBoost)과 같은 앙상블 방법은 비선형 관계와 특징 상호 작용을 잘 처리한다. Deep learning의 맥락에서 단일 출력 뉴런과 시그모이드 활성화 함수를 가진 피드포워드 신경망이 표준이며, 종종 이진 교차 엔트로피와 같은 Loss Functions으로 훈련된다. Dropout 및 Batch Normalization과 같은 기법은 일반화 및 훈련 안정성을 개선하는 데 사용된다. 순차 데이터의 경우 순환 네트워크나 트랜스포머를 적용할 수 있지만, 이진 분류는 일반적으로 정적 특징 벡터에 초점을 맞춘다.
산업 전반의 응용
이진 분류는 광범위하게 사용된다. 의료 분야에서는 Intuitive Surgical과 같은 회사가 개발한 수술 의사 결정 지원 시스템에서 볼 수 있듯이 의료 이미지나 검사 결과를 기반으로 환자가 질병을 가지고 있는지 예측하는 데 사용된다. 금융 분야에서는 사기성 신용 카드 거래를 감지하거나 대출 불이행을 예측한다. 이메일 서비스에서는 스팸을 필터링한다. 자율 주행 분야에서 Waymo와 Tesla은 객체가 보행자인지 차량인지 결정하기 위해 이진 분류를 사용한다. 자연어 처리에서는 감정 분석(긍정 대 부정)과 유해성 탐지를 지원한다. 제조업에서는 조립 라인에서 결함 제품을 식별한다. 이러한 다양성은 출력의 단순성에서 비롯되며, 경고, 자동화 또는 추가 의사 결정에 직접 사용될 수 있다.
평가 및 과제
주요 과제는 사기 탐지와 같이 한 클래스가 드문 클래스 불균형이다. 정확도는 오해의 소지가 있으며, 정밀도-재현율 곡선과 같은 지표가 선호된다. 불균형을 해결하는 기법에는 리샘플링(소수 클래스 과표본화 또는 다수 클래스 저표본화), 합성 데이터 생성 사용, 손실 함수의 클래스 가중치 조정이 포함된다. 또 다른 과제는 올바른 임계값을 선택하는 것이다. 임계값을 낮추면 재현율이 증가하지만 거짓 양성이 증가할 수 있으며, 이는 질병 누락이 오탐보다 더 나쁜 의료 검진에서 중요하다. 예측 확률이 실제 가능성을 반영하도록 보장하는 모델 보정도 의사 결정에 중요하다. 과적합은 교차 검증과 정규화를 통해 완화된다. 이 분야는 Artificial intelligence의 부상과 함께 발전해 왔으며, TensorFlow 및 PyTorch와 같은 현대 프레임워크는 이러한 모델을 구축하고 배포하기 위한 강력한 도구를 제공한다.
역사적 맥락 및 미래 방향
이진 분류의 뿌리는 1930년대 Fisher의 선형 판별 분석과 1950년대 Bernard Widrow와 Frank Rosenblatt이 도입한 퍼셉트론과 같은 통계적 방법으로 거슬러 올라간다. 1990년대에는 서포트 벡터 머신과 부스팅이 부상했으며, 2010년대에는 딥 러닝이 전면에 등장했다. 오늘날 이진 분류는 Large language model에서 콘텐츠 필터링이나 안전 검사에 사용될 수 있는 것과 같이 더 큰 시스템의 구성 요소인 경우가 많으며, OpenAI 및 Anthropic과 같은 조직에서 구현된다. 미래 방향에는 분포 변화에 대한 견고성 개선, 설명 가능성, 다중 레이블 또는 계층 구조 처리 등이 포함된다. 엣지 컴퓨팅의 성장으로 Apple 및 Samsung Electronics과 같은 회사의 장치에 경량 모델이 배포되어 클라우드 의존 없이 실시간 분류가 가능해지고 있다. 데이터가 더 풍부해짐에 따라 레이블이 지정된 데이터의 필요성을 줄이는 반지도 및 자기 지도 접근 방식으로 초점이 이동하고 있다.