조기 종료(early stopping)는 기계 학습에서 경사 하강법과 같은 반복적 최적화 방법으로 모델을 훈련할 때 과적합을 피하기 위해 사용되는 정규화의 한 형태이다. 이러한 방법은 각 반복마다 모델을 훈련 데이터에 더 잘 맞도록 업데이트한다. 어느 지점까지는 이 과정이 검증 세트와 같은 훈련 세트 외부 데이터에 대한 모델의 성능을 향상시킨다. 그러나 그 지점을 지나면 훈련 데이터에 대한 모델의 적합성을 개선하는 것이 일반화 오차의 증가를 대가로 발생시킨다. 조기 종료 규칙은 학습자가 과적합을 시작하기 전에 실행할 수 있는 반복 횟수에 대한 지침을 제공한다. 조기 종료 규칙은 다양한 수준의 이론적 기반을 가지고 여러 기계 학습 방법에 적용되어 왔다.
배경
이 섹션에서는 조기 종료 방법을 설명하는 데 필요한 기본적인 기계 학습 개념을 제시한다.
과적합
기계 학습 알고리즘은 유한한 훈련 데이터 집합을 기반으로 모델을 훈련한다. 훈련 중에는 모델이 훈련 집합에 포함된 관측치를 얼마나 잘 예측하는지에 따라 평가된다. 그러나 일반적으로 기계 학습 체계의 목표는 이전에 보지 못한 관측치를 예측하는, 즉 일반화되는 모델을 생성하는 것이다. 과적합은 모델이 훈련 집합의 데이터를 잘 맞추면서도 더 큰 일반화 오차를 발생시킬 때 발생한다. 이는 기계 학습의 핵심 과제로, 과도한 용량을 가진 모델은 기본 패턴을 학습하기보다는 노이즈를 암기할 수 있다.
정규화
기계 학습 맥락에서 정규화는 과적합을 방지하기 위해 학습 알고리즘을 수정하는 과정을 의미한다. 이는 일반적으로 학습된 모델에 어떤 종류의 평활성 제약을 부과하는 것을 포함한다. 이러한 평활성은 모델의 매개변수 수를 고정하거나 Tikhonov 정규화에서와 같이 비용 함수를 확장함으로써 명시적으로 강제될 수 있다. Tikhonov 정규화는 주성분 회귀 및 많은 다른 정규화 체계와 함께 필터 적용을 특징으로 하는 스펙트럼 정규화의 범주에 속한다. 조기 종료도 이 클래스의 방법에 속한다. 딥 러닝에서 정규화는 훈련 데이터를 암기하지 않고 큰 신경망을 훈련하는 데 중요하다.
경사 하강법 방법
경사 하강법 방법은 1차 반복적 최적화 방법이다. 각 반복은 목적 함수의 기울기의 음의 방향으로 한 걸음 이동하여 최적화 문제에 대한 근사 해를 업데이트한다. 보폭을 적절히 선택함으로써 이러한 방법은 목적 함수의 국소 최솟값으로 수렴할 수 있다. 경사 하강법은 훈련 집합에서 학습자의 오차를 반영하는 손실 함수를 정의한 다음 그 함수를 최소화함으로써 기계 학습에 사용된다. 조기 종료는 이 반복적 과정을 언제 중단할지 결정하기 때문에 경사 하강법에서 특히 관련이 있다.
분석적 결과에 기반한 조기 종료
통계적 학습 이론에서의 조기 종료
조기 종료는 통계적 학습 이론에서 발생하는 비모수 회귀 문제를 정규화하는 데 사용될 수 있다. 주어진 입력 공간, 출력 공간, 그리고 알려지지 않은 확률 측도에서 추출된 샘플에 대해 회귀 함수를 근사하는 것이 목표이다. 회귀 함수를 근사하는 한 가지 일반적인 선택은 재생 커널 힐베르트 공간의 함수를 사용하는 것이다. 이러한 공간은 무한 차원일 수 있으며, 이 경우 임의의 크기의 훈련 집합을 과적합하는 해를 제공할 수 있다. 따라서 정규화는 이러한 방법에 특히 중요하다. 비모수 회귀 문제를 정규화하는 한 가지 방법은 경사 하강법과 같은 반복적 절차에 조기 종료 규칙을 적용하는 것이다.
이러한 문제에 대해 제안된 조기 종료 규칙은 반복 횟수의 함수로서 일반화 오차의 상한에 대한 분석에 기반한다. 이들은 해결 과정을 시작하기 전에 계산할 수 있는 실행할 반복 횟수에 대한 처방을 제공한다. 이러한 이론적 기반은 조기 종료를 순수한 경험적 접근 방식과 구별한다.
#### 예: 최소 제곱 손실
Yao, Rosasco 및 Caponnetto, 2007에서 각색: 입력 공간을 n차원 실수 공간의 부분 집합으로 하고 출력 공간을 실수로 하자. 알려지지 않은 확률 측도에서 독립적으로 추출된 샘플 집합이 주어지면 최소 제곱 손실 함수에 대한 기대 위험을 최소화하는 것이 목표이다. 회귀 함수는 입력이 주어졌을 때 출력의 조건부 기대값이다. 이 설정에 대한 조기 종료 규칙은 편향과 분산을 균형 잡는 종료 반복을 제공하며, 많은 경우 최적의 수렴 속도를 이끈다.
실제 구현
실제로 조기 종료는 훈련 중 검증 세트에서 모델의 성능을 모니터링하여 구현된다. 각 에포크(또는 고정된 반복 횟수 후) 후에 모델은 검증 세트에서 평가된다. 검증 성능이 미리 정의된 횟수의 확인 동안 개선되지 않으면 훈련이 중단된다. 이 인내심 매개변수는 조기 중단 없이 검증 성능의 일시적인 변동을 허용한다. 최상의 검증 성능을 달성한 모델 매개변수는 일반적으로 마지막 반복의 최종 매개변수 대신 유지된다.
이 접근 방식은 훈련이 매우 비쌀 수 있고 과적합이 지속적인 위험인 트랜스포머 모델과 대규모 언어 모델을 훈련하는 데 널리 사용된다. 예를 들어, OpenAI와 Google DeepMind는 모델이 보지 못한 데이터에 잘 일반화되도록 훈련 파이프라인에서 조기 종료를 사용한다.
다른 정규화 방법과의 관계
조기 종료는 다른 형태의 정규화와 밀접한 관련이 있다. 특히, 특정 설정에서 경사 하강법의 조기 종료는 L2 정규화(가중치 감쇠라고도 함)와 동등하며, 반복 횟수는 정규화 강도의 역수와 유사한 역할을 한다. 이 연결은 조기 종료가 작동하는 이유에 대한 통찰력을 제공한다. 즉, 업데이트 수를 제한하여 모델의 유효 복잡성을 제한하며, 이는 가중치 감쇠가 큰 가중치를 페널티하는 방식과 유사하다.
손실 함수를 수정하는 명시적 정규화 방법과 달리 조기 종료는 암시적 정규화의 한 형태이다. 이는 목적을 변경하지 않고 최적화 경로를 제약한다. 따라서 기본 모델 아키텍처나 손실 함수를 수정하지 않고도 모든 반복적 훈련 알고리즘에 쉽게 적용할 수 있다.
이론적 기초
조기 종료의 이론적 기반은 통계적 학습 이론의 맥락에서 광범위하게 연구되어 왔다. 연구자들은 반복 횟수의 함수로서 일반화 오차의 경계를 도출했으며, 기대 오차를 최소화하는 최적의 종료 시간이 존재함을 보여주었다. 이러한 경계는 종종 가설 공간의 용량이나 복잡성과 같은 속성과 데이터의 노이즈 수준에 의존한다.
재생 커널 힐베르트 공간에서의 비모수 회귀의 경우, 조기 종료는 특정 조건에서 최소최대 최적 속도를 달성하는 것으로 나타났다. 이는 동일한 가정 하에서 다른 추정기가 더 낮은 점근 오차를 달성할 수 없음을 의미한다. 이러한 결과는 실제로 조기 종료를 사용하는 것에 대한 엄격한 정당성을 제공한다.
현대 AI에서의 응용
조기 종료는 현대 AI 시스템 훈련의 표준 구성 요소이다. 딥 러닝에서는 이미지 분류, 음성 인식, 자연어 처리와 같은 작업을 위해 합성곱 네트워크, 순환 네트워크 및 트랜스포머를 훈련하는 데 사용된다. Anthropic과 OpenAI 같은 회사는 GPT 및 Claude와 같은 모델을 훈련할 때 대규모 데이터 세트에서 과적합을 피하기 위해 조기 종료를 사용한다.
지도 학습 외에도 조기 종료는 비지도 학습 및 강화 학습 설정에서도 적용된다. 예를 들어, 생성 모델을 훈련할 때 조기 종료는 생성기가 훈련 샘플을 암기하는 것을 방지할 수 있다. 강화 학습에서는 에이전트의 검증 환경에서의 성능이 정체될 때 훈련을 중단할 수 있다.
한계 및 고려 사항
조기 종료는 간단하고 효과적이지만 한계가 있다. 검증 세트의 선택과 인내심 매개변수는 최종 모델 품질에 크게 영향을 미칠 수 있다. 검증 세트가 너무 작으면 성능 추정치가 노이즈가 많아 조기 또는 지연 종료로 이어질 수 있다. 또한 조기 종료는 학습률 및 배치 크기와 같은 다른 하이퍼파라미터와 상호 작용할 수 있어 단독으로 튜닝하기 어렵게 만든다.
또 다른 고려 사항은 조기 종료가 검증 성능이 일반화의 신뢰할 수 있는 대리 지표라고 가정한다는 것이다. 데이터 분포가 시간에 따라 변하는 경우와 같은 일부 상황에서는 이 가정이 성립하지 않을 수 있다. 그럼에도 불구하고 조기 종료는 기계 학습 실무자의 도구 상자에서 기본적인 도구로 남아 있다.