영어에서 번역됨

정규화는 가중치 페널티, 드롭아웃, 조기 종료를 포함한 일련의 기법으로, 과적합을 줄이고 머신 러닝 모델이 새로운 데이터에 얼마나 잘 일반화되는지 개선하는 데 사용된다.

정규화는 기계 학습에서 모델이 훈련 데이터에 너무 정밀하게 맞춰지는 것을 억제하여 새로운 데이터에 더 잘 일반화되도록 하는 광범위한 기법군을 의미합니다. 대부분의 정규화 방법은 모델이 학습하려는 대상을 바꾸기보다는, 복잡성을 직접 페널티로 부과하거나, 훈련 중 제어된 노이즈를 주입하거나, 모델이 훈련 세트의 특이성을 암기할 기회를 갖기 전에 훈련을 중단하는 방식으로 학습이 허용되는 방식을 변경합니다.

가중치 기반 방법

가장 오래되고 직접적인 접근 방식은 모델 가중치의 크기에 기반한 페널티 항을 손실 함수에 추가하여, 데이터가 더 큰 값을 강력히 정당화하지 않는 한 옵티마이저가 더 작고 단순한 가중치 값을 선호하도록 장려합니다. L2 정규화는 가중치 감쇠 또는 릿지 정규화라고도 하며, 제곱 가중치의 합을 페널티로 부과하고 모든 가중치를 0으로 부드럽게 수축시키는 경향이 있습니다. L1 정규화는 절대 가중치 값의 합을 페널티로 부과하고 일부 가중치를 정확히 0으로 밀어내어 사실상 특성 선택을 수행합니다. 현대 딥러닝에서 가중치 감쇠는 일반적으로 손실에 명시적 항으로 추가되기보다는, AdamW로 알려진 Adam의 수정과 같이 옵티마이저 내부에 직접 적용됩니다.

구조적 및 확률적 방법

드롭아웃은 2012년경 제프리 힌튼의 그룹이 도입하고 2014년 널리 인용된 논문에서 공식화한 것으로, 각 훈련 단계에서 신경망 유닛의 일부를 무작위로 비활성화하여 네트워크가 단일 유닛이나 고정된 유닛 조합에 과도하게 의존하지 않도록 강제하며, 가중치를 공유하는 하위 네트워크의 암시적 앙상블을 효과적으로 훈련시킵니다. 배치 정규화와 그 후속 기법들은 주로 훈련을 안정화하고 가속화하기 위해 도입되었지만, 훈련 중 각 계층의 입력에 노이즈를 추가하여 정규화 부수 효과도 있습니다. 데이터 증강은 회전되거나 잘린 이미지, 또는 의역된 텍스트와 같은 수정된 훈련 예제 사본을 생성하여 훈련 데이터의 유효 다양성을 인위적으로 확장하고 모델이 피상적이고 일반화되지 않는 패턴에 집착할 가능성을 줄입니다.

조기 중단 및 모델 선택

조기 중단은 훈련 손실이 계속 감소하더라도 별도로 유지된 검증 세트에서의 성능이 더 이상 개선되지 않으면 훈련을 중단하며, 과적합을 정의하는 훈련 및 검증 성능 간의 차이를 직접적으로 겨냥합니다. 이를 위해서는 훈련 전반에 걸쳐 검증 손실을 모니터링해야 하며, 단지 종료 규칙만 필요할 뿐 모델이나 손실 함수 자체를 변경할 필요가 없기 때문에 가장 간단하고 널리 사용되는 정규화 기법 중 하나입니다.

대규모 모델에서의 정규화

다소 직관에 반하지만, 가장 큰 대규모 언어 모델딥러닝 시스템은 종종 더 작은 모델보다 가벼운 명시적 정규화를 사용합니다. 그 이유는 제한된 횟수의 패스로 방대하고 다양한 훈련 데이터를 학습하면 자연스러운 정규화 형태가 제공되기 때문입니다. 모델은 동일한 예제를 거의 또는 전혀 두 번 보지 못하여 암기할 기회가 거의 없습니다. 특히 드롭아웃은 대규모 트랜스포머 사전 훈련에서 자주 줄이거나 완전히 제거되지만, 더 좁은 데이터 세트에 대한 과적합이 더 현실적인 위험인 소규모 미세 조정 단계에서는 여전히 일반적으로 사용됩니다.

분류:machine-learning·deep-learning·model-training
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사