영어에서 번역됨

부트스트랩 집계(bagging)는 기계 학습에서 앙상블 메타 알고리즘으로, 부트스트랩 샘플에서 여러 모델을 훈련시키고 그 예측을 결합하여 안정성과 정확성을 향상시킵니다.

부트스트랩 애그리게이팅(bootstrap aggregating)은 일반적으로 배깅(bagging)이라고 불리며, 머신러닝에서 분류 및 회귀 알고리즘의 안정성과 정확성을 향상시키기 위해 설계된 앙상블 메타 알고리즘이다. 이는 분산을 줄이고 과적합을 완화하는 데 도움을 준다. 배깅은 의사 결정 트리 방법에 자주 적용되지만, 모든 유형의 모델에 사용될 수 있다. 이는 여러 모델을 결합하여 단일 예측을 생성하는 더 넓은 앙상블 평균화 접근 방식의 특수한 경우이다.

이 기법은 1990년대에 Thomas Dietterich에 의해 소개되었지만, "배깅"이라는 용어는 1994년 논문에서 Michael Jordan에 의해 만들어졌다. 배깅은 이후 머신러닝의 기초 도구가 되었으며, 특히 랜덤 포레스트 및 기타 앙상블 방법의 개발에 중요한 역할을 했다.

핵심 아이디어

배깅의 핵심 아이디어는 평균화의 힘을 활용하는 것이다. 훈련 데이터의 약간 다른 하위 집합에서 훈련된 개별 모델은 상관되지 않은 오류를 갖는 경향이 있다. 예측을 평균화함으로써 이러한 오류는 상쇄되어 더 견고하고 정확한 최종 모델을 생성한다. 이는 훈련 데이터의 작은 변화가 학습된 모델의 큰 변화로 이어질 수 있는 불안정한 알고리즘에 특히 유용하다.

배깅 알고리즘

크기 \( n \)의 표준 훈련 세트 \( D \)가 주어지면, 배깅은 \( D \)에서 균일하게 그리고 복원 추출로 샘플링하여 각각 크기 \( n' \)인 \( m \)개의 새로운 훈련 세트 \( D_i \)를 생성한다. 이 샘플링 과정을 부트스트래핑이라고 한다. \( n' = n \)일 때, 큰 \( n \)에 대해 각 \( D_i \)는 \( D \)의 고유 샘플 중 약 63.2%를 포함할 것으로 예상되며, 나머지는 중복이다. 이 비율은 극한 \( 1 - 1/e \)에서 발생한다. 복원 추출은 각 샘플의 선택이 이전 선택에 의존하지 않으므로 각 부트스트랩 샘플이 서로 독립적임을 보장한다.

\( m \)개의 부트스트랩 샘플을 생성한 후, 각 샘플에 하나씩 \( m \)개의 모델을 적합시킨다. 회귀 작업의 경우 최종 예측은 개별 모델 출력의 평균이다. 분류 작업의 경우 최종 예측은 투표, 일반적으로 다수결 투표로 결정된다.

주요 용어: 원본, 부트스트랩 및 아웃오브백 데이터 세트

부트스트랩 애그리게이팅에서는 원본 데이터 세트, 부트스트랩 데이터 세트, 아웃오브백 데이터 세트의 세 가지 유형의 데이터 세트가 관련된다. 원본 데이터 세트는 주어진 훈련 데이터이다. 부트스트랩 데이터 세트는 원본 데이터 세트에서 복원 추출로 무작위 샘플링하여 생성되며 원본과 동일한 크기를 갖는다. 예를 들어, 원본 데이터 세트가 Emily, Jessie, George, Constantine, Lexi, Theodore, John, James, Rachel, Anthony, Ellie, Jamal이라는 12명으로 구성된 경우, 부트스트랩 샘플에는 James, Ellie, Constantine, Lexi, John, Constantine, Theodore, Constantine, Anthony, Lexi, Constantine, Theodore가 포함될 수 있다. 여기서 Constantine은 네 번, Lexi는 두 번, Theodore는 두 번 나타난다.

아웃오브백 데이터 세트는 부트스트랩 샘플에서 선택되지 않은 관측치로 구성된다. 예에서 아웃오브백 세트는 Emily, Jessie, George, Rachel, Jamal이 된다. 세트는 중복을 무시하므로 원본 세트와 부트스트랩 세트의 고유 요소 간의 차이가 취해진다.

의사 결정 트리 및 랜덤 포레스트에의 적용

배깅은 종종 의사 결정 트리와 함께 사용되며, 이는 랜덤 포레스트의 생성으로 이어진다. 랜덤 포레스트에서 각 트리는 부트스트랩 샘플로 훈련되며, 추가로 각 분할에서 소수의 무작위 특징 하위 집합만 고려된다. 이는 트리 간에 더 큰 다양성을 도입하여 앙상블을 더 견고하게 만든다.

부트스트랩 데이터 세트에서 의사 결정 트리를 구축하기 위해 알고리즘은 각 특징을 검사하고 샘플을 양성 및 음성 클래스로 얼마나 잘 분리하는지 결정한다. 이는 종종 참양성, 거짓양성, 참음성, 거짓음성을 나열하는 혼동 행렬을 사용하여 수행된다. 특징은 정보 이득 또는 "좋음" 측정과 같은 지표를 기반으로 순위가 매겨진다. 최상위 특징은 샘플을 특징을 보유한 집합과 보유하지 않은 집합의 두 집합으로 분할하는 데 사용된다. 이 과정은 최대 깊이와 같은 중지 기준에 도달할 때까지 각 하위 집합에 대해 재귀적으로 반복된다. 잎에서는 샘플이 다수 클래스를 기반으로 양성 또는 음성으로 분류된다.

배깅과 무작위 특징 선택을 결합한 랜덤 포레스트는 높은 정확도를 달성하는 것으로 나타났으며 실제로 널리 사용된다. 포레스트의 트리 수는 성능에 영향을 미친다. 예를 들어, 50개의 트리를 가진 모델은 일반적으로 10개의 트리를 가진 모델보다 더 잘 수행되는데, 이는 더 많은 트리로 인해 관측치가 모든 부트스트랩 샘플에서 제외될 확률이 감소하기 때문이다.

다양한 알고리즘에 미치는 영향

배깅은 인공 신경망, 분류 및 회귀 트리, 선형 회귀의 하위 집합 선택을 포함하는 불안정한 절차에 개선을 가져온다. 또한 사전 이미지 학습을 개선하는 것으로 나타났다. 반면, 배깅은 k-최근접 이웃과 같은 안정적인 방법의 성능을 약간 저하시킬 수 있는데, 이는 유사한 모델에 대한 평균화가 분산을 크게 줄이지 않고 편향을 도입할 수 있기 때문이다.

이론적 통찰

배깅의 효과는 분산 감소에 뿌리를 두고 있다. 깊은 의사 결정 트리와 같이 분산이 높은 모델의 경우 훈련 데이터의 작은 섭동이 매우 다른 모델로 이어질 수 있다. 부트스트랩 샘플로 훈련된 여러 모델을 평균화함으로써 최종 예측의 분산은 종종 편향의 큰 증가 없이 감소한다. 이는 딥러닝인공지능 응용 프로그램에서 접하는 고차원 설정에서 특히 중요하다.

실용적 고려 사항

배깅은 각 모델을 독립적으로 훈련할 수 있으므로 계산적으로 효율적이며 병렬화하기 쉽다. 이는 아마존 웹 서비스구글 클라우드와 같은 클라우드 제공업체가 사용하는 대규모 머신러닝 파이프라인에서의 인기에 기여했다. 실제로 부트스트랩 샘플 수 \( m \)는 종종 사용 가능한 계산 리소스를 기반으로 선택되며, 일반적인 값은 10에서 수백까지 다양하다.

다른 앙상블 방법과의 관계

배깅은 부스팅 및 스태킹과 같은 다른 앙상블 기법과 밀접하게 관련된다. 부스팅은 오류를 수정하기 위해 모델을 순차적으로 훈련시키는 데 초점을 맞추는 반면, 배깅은 모델을 병렬로 훈련시키고 평균화 또는 투표로 결합한다. 이러한 차이는 배깅을 분산 감소에 특히 적합하게 만드는 반면, 부스팅은 편향 감소에 더 효과적이다. 의사 결정 트리와 함께 배깅의 특정 구현인 랜덤 포레스트는 머신러닝에서 가장 널리 사용되는 앙상블 방법 중 하나이다.

결론

배깅은 모델 안정성과 정확성을 향상시키는 간단하면서도 강력한 방법을 제공하는 머신러닝의 기본 기법으로 남아 있다. 그 원리는 더 고급 앙상블 방법의 개발에 영향을 미쳤으며, 전통적인 표 형식 데이터에서부터 신경망대규모 언어 모델과 같은 복잡한 영역에 이르기까지 현대 응용 프로그램에서 여전히 관련성이 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ensemble-learning·machine-learning·statistical-classification
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사