부트스트랩 집계

영어에서 번역됨

부트스트랩 애그리게이팅(배깅)은 앙상블 머신러닝 기법으로, 훈련 데이터의 무작위 부트스트랩 샘플에서 여러 기본 모델을 훈련하고 이들의 예측을 결합하여 분산을 줄이고 안정성을 향상시킵니다.

부트스트랩 애그리게이션(Bootstrap aggregating)은 일반적으로 배깅(bagging)으로 알려져 있으며, 예측 모델의 정확성과 견고성을 향상시키기 위해 설계된 머신 러닝의 앙상블 학습 방법이다. 이 방법은 원본 훈련 데이터셋에서 여러 부트스트랩 샘플(복원 추출을 통한 무작위 부분 집합)을 생성하고, 각 샘플에 대해 별도의 기본 모델을 훈련시킨 다음, 그 예측을 집계하는 방식으로 작동한다. 회귀 작업의 경우 최종 예측은 일반적으로 모든 기본 모델 출력의 평균이며, 분류의 경우 다수결 투표이다. 배깅은 주로 분산을 줄여 과적합을 완화하는 데 도움이 되며, 결정 트리와 같은 고분산 알고리즘에 특히 효과적이다.

이 기법은 1994년 레오 브레이먼(Leo Breiman)이 그의 논문 "Bagging Predictors"에서 소개했다. 이는 순차적으로 오류를 교정하는 부스팅(boosting)과 메타 러너를 통해 다양한 모델을 결합하는 스태킹(stacking)과 구별되는 앙상블 학습의 기초 개념이다. 배깅은 실제로 널리 사용되며, 특히 특징 부분 샘플링과 결합된 랜덤 포레스트의 핵심으로 가장 잘 알려져 있다. 그 단순성과 효과성 덕분에 금융에서 의료에 이르기까지 학술 연구와 산업 응용 모두에서 표준 도구가 되었다.

역사적 발전

배깅은 1990년대 초반의 광범위한 통계 및 머신 러닝 연구에서 등장했으며, 이 시기는 일반화를 개선하기 위해 여러 모델을 결합하는 것에 대한 관심이 증가하던 때였다. 캘리포니아 대학교 버클리 캠퍼스의 통계학자 레오 브레이먼은 브래들리 에프론(Bradley Efron)의 부트스트랩 방법에 대한 초기 연구를 바탕으로 1994년에 이 접근법을 공식화했다. 브레이먼은 이론적으로나 경험적으로나 교란된 데이터셋에서 훈련된 모델의 예측을 평균화하면 오류를 줄일 수 있음을 입증했으며, 특히 작은 데이터 변동에 따라 출력이 크게 변하는 불안정한 학습기에서 효과적임을 보였다.

이 방법은 2001년 브레이먼이 랜덤 포레스트를 도입한 후 빠르게 주목을 받았으며, 이는 결정 트리의 각 분할에서 특징의 부분 집합을 무작위로 선택하여 배깅을 확장했다. 이 혁신은 기본 모델 간의 상관 관계를 더욱 낮추어 상당한 성능 향상을 가져왔다. 그 이후로 배깅은 scikit-learn, R의 randomForest 패키지, TensorFlow Decision Forests를 포함한 수많은 소프트웨어 라이브러리에 통합되어 전 세계 실무자들이 쉽게 사용할 수 있게 되었다.

알고리즘 세부 사항

배깅 알고리즘은 간단한 방식으로 진행된다. 크기가 n인 훈련 세트가 주어지면, 이 과정은 각각 크기가 n인 B개의 부트스트랩 샘플을 복원 추출로 균일하게 생성한다. 이는 일부 원본 인스턴스가 샘플에 여러 번 나타날 수 있는 반면, 다른 인스턴스는 생략된다는 것을 의미한다(대략 63.2%의 고유 인스턴스가 주어진 샘플에 나타나며, 나머지는 중복이다). 각 샘플에 대해 기본 모델이 독립적으로 훈련되며, 종종 동일한 알고리즘과 하이퍼파라미터를 사용한다. 기본 모델은 결정 트리, 신경망 또는 다른 학습기일 수 있다.

집계는 작업에 따라 달라진다. 회귀의 경우 예측은 평균화된다: \( \hat{f}(x) = \frac{1}{B} \sum_{b=1}^{B} \hat{f}_b(x) \). 분류의 경우 최종 클래스는 기본 모델 간의 다수결 투표로 결정된다. 부트스트랩 샘플 수 B는 주요 하이퍼파라미터이며, 일반적인 값은 50에서 500 사이이고, 수백 개를 넘으면 수익이 감소한다. 배깅은 기본 모델에 대한 교차 검증을 요구하지 않으며, 주어진 부트스트랩 샘플에 포함되지 않은 인스턴스인 out-of-bag 샘플을 사용하여 별도의 검증 세트 없이 일반화 오류를 추정할 수 있다.

이론적 기초

배깅의 효과는 분산 감소에서 비롯된다. 예측 분산이 \( \sigma^2 \)이고 모델 간 쌍별 상관 관계가 \( \rho \)인 기본 모델의 경우, 앙상블 평균의 분산은 대략 \( \rho \sigma^2 + (1-\rho)\sigma^2/B \)이다. B가 증가함에 따라 두 번째 항은 사라지고 \( \rho \sigma^2 \)만 남는다. 따라서 배깅은 기본 모델이 불안정하고(고분산) 상관 관계가 너무 높지 않을 때 가장 잘 작동한다. 결정 트리는 작은 데이터 교란이 다른 분할로 이어지지만 전체 구조는 상관 관계를 적당히 유지할 만큼 충분히 유사하기 때문에 이상적이다.

브레이먼의 원래 분석은 기본 학습기가 불안정하다면 배깅이 회귀의 평균 제곱 오류와 분류의 오분류율을 줄일 수 있음을 보여주었다. 이는 분산이 이미 낮은 선형 회귀와 같은 안정적인 학습기에는 크게 도움이 되지 않는다. 이 방법은 또한 기본 모델 예측의 분포를 통해 불확실성 추정을 위한 자연스러운 메커니즘을 제공하며, 이를 사용하여 예측 구간을 구성할 수 있다.

실제 응용

배깅은 다양한 분야에 적용된다. 금융에서는 신용 평가와 사기 탐지에 사용되며, 여기서는 거짓 양성을 줄이는 것이 중요하다. 의료에서는 배깅된 결정 트리가 전자 건강 기록에서 환자 결과를 예측하고 질병을 진단하는 데 도움이 된다. 원격 감지에서는 랜덤 포레스트(배깅 변형)가 위성 이미지에서 토지 피복을 분류한다. 이 방법은 자연어 처리에서 텍스트 분류에도 일반적이지만, 딥 러닝 모델은 종종 다른 정규화 기법에 의존한다.

주목할 만한 응용 중 하나는 Machine learning 경쟁의 앙상블 방법으로, 배깅은 종종 부스팅과 결합되거나 예측을 안정화하는 최종 단계로 사용된다. 예를 들어, Netflix Prize와 Kaggle 경쟁에서 참가자들은 종종 최고의 모델을 배깅하여 작은 정확성 향상을 얻는다. 산업에서는 Amazon Web ServicesGoogle Cloud와 같은 회사가 배깅 구현을 포함한 관리형 서비스를 제공하여 수동 오케스트레이션 없이 확장 가능한 모델 훈련을 가능하게 한다.

한계 및 확장

배깅에는 몇 가지 한계가 있다. 이는 편향을 줄이지 않으며, 기본 모델이 체계적으로 과소적합하는 경우 배깅은 이를 교정하지 않는다. 또한 기본 모델 수에 따라 계산 비용이 선형적으로 증가하지만, 각 모델이 독립적이므로 훈련은 쉽게 병렬화할 수 있다. 많은 모델을 저장할 때 메모리 사용량이 높을 수 있다. 더욱이 배깅은 단일 모델이 이미 잘 일반화되는 매우 큰 데이터셋이나 선형 서포트 벡터 머신과 같은 안정적인 알고리즘에는 덜 효과적이다.

확장은 이러한 문제 중 일부를 해결한다. 랜덤 포레스트는 트리 간 상관 관계를 더욱 낮추기 위해 특징 부분 샘플링을 추가한다. 페이스팅(pasting, 또는 서브배깅)은 복원 없이 더 작은 무작위 샘플에서 훈련하여 계산 부하를 줄인다. 브래깅(bragging, 부트스트랩 애그리게이션과 그래디언트 부스팅의 결합)은 정확성을 향상시키기 위해 배깅과 부스팅을 결합한다. 신경망의 경우 딥 앙상블(deep ensembles)이라는 관련 기법이 서로 다른 무작위 초기화로 여러 네트워크를 훈련시키며, 이는 가중치 수준에서 배깅을 효과적으로 적용한다. 이러한 변형은 현대 앙상블 학습에 대한 브레이먼의 원래 아이디어의 지속적인 영향을 강조한다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ensemble-learning·machine-learning·statistical-methods
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사