학습률 스케줄

영어에서 번역됨

학습률 스케줄은 훈련 중 최적화 알고리즘의 스텝 크기를 조정하는 전략으로, 수렴 속도와 안정성 사이의 균형을 맞춘다. 일반적인 스케줄로는 시간 기반, 단계 기반, 지수 감쇠가 있으며, 종종 모멘텀과 결합된다.

기계 학습 및 통계에서 학습률은 손실 함수의 최솟값을 향해 이동하는 각 반복 단계에서 스텝 크기를 결정하는 최적화 알고리즘의 튜닝 매개변수입니다. 새로 획득한 정보가 기존 정보를 얼마나 덮어쓰는지에 영향을 주기 때문에, 이는 은유적으로 기계 학습 모델이 "학습하는" 속도를 나타냅니다. 적응 제어 문헌에서 학습률은 일반적으로 이득(gain)이라고 합니다.

학습률을 설정할 때 수렴 속도와 오버슈팅 사이에는 절충이 있습니다. 하강 방향은 일반적으로 손실 함수의 기울기에서 결정되지만, 학습률은 해당 방향으로 얼마나 큰 스텝을 취할지 결정합니다. 학습률이 너무 높으면 학습이 최솟값을 뛰어넘게 되고, 너무 낮으면 수렴하는 데 너무 오래 걸리거나 바람직하지 않은 지역 최솟값에 갇힐 수 있습니다.

더 빠른 수렴을 달성하고 진동 및 바람직하지 않은 지역 최솟값에 갇히는 것을 방지하기 위해 학습률은 학습률 스케줄에 따라 또는 적응형 학습률을 사용하여 훈련 중에 종종 변경됩니다. 학습률 및 그 조정은 매개변수마다 다를 수 있으며, 이 경우 뉴턴 방법에서 헤세 행렬의 역행렬에 대한 근사로 해석될 수 있는 대각 행렬입니다. 학습률은 준뉴턴 방법 및 관련 최적화 알고리즘에서 부정확한 선 탐색에 의해 결정되는 스텝 길이와 관련이 있습니다.

핵심 개념: 감쇠와 모멘텀

학습률 스케줄은 학습 중에 학습률을 변경하며, 대부분 에폭 또는 반복 사이에 변경됩니다. 이는 주로 감쇠(decay)와 모멘텀(momentum)이라는 두 매개변수로 수행됩니다. 감쇠는 학습을 안정적인 위치에 정착시키고 진동을 피하는 역할을 하며, 이는 너무 높은 일정한 학습률이 학습이 최솟값을 앞뒤로 뛰어넘게 할 때 발생할 수 있는 상황으로, 하이퍼매개변수에 의해 제어됩니다.

모멘텀은 언덕을 굴러 내려가는 공과 유사합니다. 목표는 공이 언덕의 가장 낮은 지점, 즉 가장 낮은 오류에 정착하는 것입니다. 모멘텀은 오류 비용 기울기가 오랫동안 같은 방향으로 향할 때 학습을 가속화(유효 학습률 증가)하고 작은 범프를 '굴러 넘어' 지역 최솟값을 피하는 데 도움을 줍니다. 모멘텀은 공의 질량과 유사한 하이퍼매개변수에 의해 제어되며, 이는 수동으로 선택해야 합니다 - 너무 높으면 찾고자 하는 최솟값을 넘어 굴러가고, 너무 낮으면 목적을 달성하지 못합니다. 모멘텀을 고려하는 공식은 감쇠보다 더 복잡하지만 Keras와 같은 딥 러닝 라이브러리에 대부분 내장되어 있습니다.

시간 기반 스케줄

시간 기반 학습 스케줄은 이전 시간 반복의 학습률에 따라 학습률을 변경합니다. 감쇠를 고려한 수학 공식은 다음과 같습니다:

\[ \eta_{n+1} = \frac{\eta_0}{1 + dn} \]

여기서 \(\eta\)는 학습률, \(\eta_0\)는 초기 학습률, \(d\)는 감쇠 매개변수, \(n\)은 반복 단계입니다. 이 스케줄은 학습률을 부드럽고 단조롭게 감소시키며, 훈련이 진행됨에 따라 감소가 덜 공격적이 됩니다. 구현이 간단하고 초기 학습률과 감쇠 상수만 필요하므로 초기 신경망 실험에서 일반적인 선택입니다.

단계 기반 스케줄

단계 기반 학습 스케줄은 사전 정의된 단계에 따라 학습률을 변경합니다. 감쇠 적용 공식은 다음과 같습니다:

\[ \eta_n = \eta_0 d^{\left\lfloor \frac{1+n}{r} \right\rfloor} \]

여기서 \(\eta_n\)은 반복 \(n\)에서의 학습률, \(\eta_0\)는 초기 학습률, \(d\)는 각 감소 시 학습률이 얼마나 변경되어야 하는지(0.5는 절반 감소에 해당), \(r\)은 감소율 또는 학습률이 감소되는 빈도(10은 10회 반복마다 감소)를 나타냅니다. 여기서 바닥 함수(\(\lfloor \dots \rfloor\))는 입력 값을 1보다 작은 모든 값에 대해 0으로 떨어뜨립니다. 이 접근 방식은 대규모 언어 모델트랜스포머 훈련에서 널리 사용되며, 실무자들은 총 훈련 단계의 특정 비율 후와 같은 사전 결정된 이정표에서 학습률을 0.1 또는 0.5의 요인으로 줄이는 경우가 많습니다.

지수 스케줄

지수 학습 스케줄은 단계 기반과 유사하지만 단계 대신 감소하는 지수 함수를 사용합니다. 감쇠를 고려한 수학 공식은 다음과 같습니다:

\[ \eta_n = \eta_0 e^{-dn} \]

여기서 \(d\)는 감쇠 매개변수입니다. 이 스케줄은 초기 단계에서 시간 기반 감쇠보다 빠르고 나중에는 더 느린 부드럽고 연속적인 감쇠를 제공합니다. 손실 지형이 비교적 매끄럽고 완만한 감소가 필요할 때 종종 선호됩니다. 변형에는 학습률이 주기적으로 더 높은 값으로 재설정되어 지역 최솟값을 벗어나는 웜 재시작이 있는 지수 감쇠가 포함되며, 이는 커리큘럼 학습기울기 클리핑에 대한 최근 연구에서 탐구된 기술입니다.

코사인 및 웜업 스케줄

고전적인 스케줄 외에도 현대 실무에서는 초기 값에서 거의 0까지 코사인 곡선을 따르는 코사인 어닐링을 자주 사용합니다. 이 스케줄은 종종 학습률이 수백 또는 수천 단계에 걸쳐 작은 값에서 초기 최대값으로 증가하는 선형 웜업 단계와 결합됩니다. 웜업은 매우 깊은 네트워크와 대규모 트랜스포머를 훈련할 때 특히 중요하며, 무작위로 초기화된 가중치에 대한 큰 업데이트로 인한 초기 불안정성을 방지합니다. 웜업이 있는 코사인 스케줄은 동일한 훈련 예산에서 단계 기반 감쇠보다 더 나은 최종 성능을 제공하는 경향이 있어 많은 오픈AI구글 딥마인드 연구 구현에서 표준 선택이 되었습니다.

적응형 학습률 방법

학습률 스케줄의 문제는 모두 각 학습 세션에 대해 수동으로 선택해야 하고 문제나 사용된 모델에 따라 크게 달라질 수 있는 하이퍼매개변수에 의존한다는 것입니다. 이를 해결하기 위해 Adagrad, Adadelta, RMSprop, Adam과 같은 다양한 유형의 적응형 경사 하강 알고리즘이 있으며, 이는 일반적으로 Keras와 같은 딥 러닝 라이브러리에 내장되어 있습니다. 이러한 방법은 과거 기울기 정보를 기반으로 매개변수별 학습률을 조정하여 많은 경우 수동으로 튜닝된 스케줄의 필요성을 효과적으로 제거합니다. 예를 들어, Adam은 과거 기울기의 제곱 합의 제곱근의 역수로 스케일링된 매개변수별 학습률을 유지하여 자동 어닐링의 형태를 제공합니다. 적응형 방법은 종종 더 빠르게 수렴하지만 잘 튜닝된 스케줄보다 특정 작업에서 일반화 성능이 더 나쁠 수 있어 적응형 최적화기 위에 고정 스케줄을 사용하는 하이브리드 접근 방식이 등장합니다.

실용적 고려 사항 및 선택

학습률 스케줄을 선택하는 것은 모델 아키텍처, 데이터 세트 크기, 최적화 알고리즘, 사용 가능한 계산 예산 등 여러 요소의 균형을 맞추는 것을 포함합니다. 간단한 데이터 세트의 작은 모델의 경우 일정한 학습률이나 간단한 시간 기반 감쇠로 충분할 수 있습니다. 생성형 AI 시스템과 같은 대규모 훈련 실행의 경우 실무자들은 종종 웜업, 코사인 감쇠, 주기적인 재시작의 조합을 사용합니다. 초기 학습률 자체는 일반적으로 학습률 범위 테스트를 통해 선택되며, 여기서 학습률은 소수의 반복에 걸쳐 선형적으로 증가하고 손실이 가장 가파르게 감소하는 값이 선택됩니다. AWS구글 클라우드를 포함한 많은 프레임워크는 수동 부담을 줄이는 내장 스케줄러 및 자동 튜닝 도구를 제공합니다.

다른 기술과의 관계

학습률 스케줄은 다른 훈련 기술과 밀접하게 상호 작용합니다. 배치 정규화레이어 정규화는 손실 지형을 안정화하여 더 높은 학습률과 더 간단한 스케줄을 허용할 수 있습니다. 가중치 초기화는 적절한 시작 학습률에 영향을 미치며, 잘못 스케일링된 초기 가중치는 발산을 피하기 위해 더 낮은 학습률이 필요할 수 있습니다. 기울기 클리핑은 폭발적인 기울기를 방지하며, 이는 공격적인 스케줄이나 순환 아키텍처를 사용할 때 특히 관련이 있습니다. 강화 학습에서 스케줄은 종종 탐색 전략과 연결되며, RLHF에서 언어 모델을 정렬할 때 학습률은 사전 훈련된 지식을 보존하면서 인간 피드백에 적응하도록 신중하게 어닐링됩니다.

역사적 배경 및 연구

학습률을 변경하는 개념은 적응 제어 및 확률적 경사 하강법의 초기 연구로 거슬러 올라갑니다. MIT CSAIL스탠포드 AI 랩과 같은 기관의 연구자들은 다양한 감쇠 함수의 이론적 속성을 연구하여 비볼록 설정에서 수렴을 위해 감쇠 학습률이 필요함을 보여주었습니다. 1980년대 버나드 위드로우 등에 의한 모멘텀 도입은 현대 최적화기의 기초를 마련했습니다. 나중에 데이비드 카플란 등을 포함한 연구자들이 개척한 Adagrad 및 Adam과 같은 적응형 방법의 개발은 수동 스케줄에서 자동 매개변수별 조정으로 초점을 전환했습니다. 오늘날 스케줄 선택은 여전히 활발한 연구 영역이며, 잔차 네트워크U-Net을 포함한 다양한 모델 계열에서 다양한 감쇠 형태의 일반화 속성을 비교하는 연구가 진행 중입니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning·optimization·training-techniques
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사