영어에서 번역됨

그로킹은 기계 학습에서 신경망이 과적합된 지 오랜 시간이 지난 후에 갑자기 일반화되는 현상으로, 확장된 훈련 동안 암기에서 진정한 이해로 전환되는 것을 말한다.

그로킹(grokking)은 머신러닝, 특히 딥러닝에서 관찰되는 현상으로, 신경망이 훈련 데이터를 장기간 암기하는 것처럼 보이다가 갑자기 진정한 일반화 상태로 전환되는 것을 말한다. 이 용어는 2022년 OpenAI 연구자들이 처음 만들어냈으며, 겉보기에는 과적합된 상태가 오래 지속된 후에 보지 못한 데이터에 대한 성능이 갑작스럽고 종종 극적으로 개선되는 현상을 설명한다. 이러한 지연된 일반화는 모델이 점진적으로 개선되거나 초기에 정체되는 일반적인 훈련 역학과 대조되며, 신경망이 어떻게 학습하는지 이해하는 데 중요한 시사점을 제공한다.

이 현상은 2022년 Alethea Power와 OpenAI 동료들이 발표한 논문에서 처음으로 체계적으로 기록되었으며, 그들은 모듈러 산술과 같은 알고리즘 작업에 대해 훈련된 소형 트랜스포머 모델을 연구했다. 그들은 모델이 훈련 데이터에서 거의 완벽한 정확도를 달성한 후에도 검증 데이터에서 눈에 띄는 개선 없이 수많은 추가 단계를 훈련하다가 갑자기 거의 완벽한 일반화를 달성하는 것을 발견했다. 로버트 A. 하인라인의 1961년 소설 낯선 땅의 이방인에서 이름을 따온 이 "그로킹" 사건은 이후 다양한 아키텍처와 작업에서 재현되었으며, 그 기본 메커니즘에 대한 연구를 촉발했다.

특성 및 조건

그로킹은 일반적으로 특정 조건에서 훈련된 모델에서 발생한다: 소규모 데이터셋, 단순한 알고리즘 작업, 그리고 특정 정규화 기법. 이 현상은 큰 가중치를 페널티하는 가중치 감쇠(weight decay) 또는 드롭아웃이나 데이터 증강과 같은 다른 형태의 정규화로 모델을 훈련할 때 가장 두드러진다. 많은 실험에서 그로킹은 모델이 훈련 데이터를 완전히 과적합한 후에만 나타나며, 전환은 종종 긴 정체 기간 후 수백 또는 수천 훈련 단계 내에 급격하게 발생한다.

그로킹 전의 지연은 상당할 수 있으며, 초기 적합보다 수십 배 더 많은 훈련 단계가 필요한 경우도 있다. 예를 들어, 원래 모듈러 산술 실험에서 모델은 데이터를 암기하는 데 수만 단계가 걸렸고, 수십만 단계 동안 정체된 후 갑자기 일반화되었다. 이 동작은 하이퍼파라미터에 민감하다: 더 큰 모델은 더 빨리 그로킹하는 경향이 있는 반면, 더 작은 모델은 결코 그로킹하지 않을 수 있으며, 가중치 감쇠의 존재가 종종 중요하다.

이론적 설명

그로킹을 설명하기 위해 여러 이론이 제안되었지만, 2025년 현재 합의는 없다. 두드러진 가설 중 하나는 그로킹이 모델 내부 표현에서 암기와 일반화 사이의 경쟁에서 발생한다는 것이다. 정체 기간 동안 네트워크는 훈련 예제를 복잡하고 과적합된 방식으로 인코딩하지만, 경사 하강법은 점차 이러한 표현을 단순화하여 결국 더 일반적인 해결책을 발견한다. 이 과정은 시스템이 갑자기 더 낮은 에너지 상태로 재조직되는 물리학의 상전이와 유사하다.

토론토 대학 연구자들을 포함한 다른 연구 라인은 그로킹이 손실 지형의 기하학과 관련이 있다고 제안한다. 모델은 처음에 일반화가 나쁜 날카로운 최솟값에 갇힐 수 있지만, 훈련이 계속됨에 따라 더 잘 일반화되는 평평한 최솟값으로 탈출한다. 가중치 감쇠는 날카로운 해결책을 페널티함으로써 이러한 탈출을 장려한다. 또한 일부 연구는 그로킹을 산술 작업의 푸리에 특징과 같은 모듈식 또는 구조화된 표현의 출현과 연결했으며, 이를 통해 모델은 암기된 예제가 아닌 일반 규칙을 사용하여 답을 계산할 수 있다.

머신러닝에 대한 시사점

그로킹은 과적합과 일반화에 대한 기존의 통념에 도전한다. 표준 관행에서는 검증 성능이 정체될 때 훈련을 중단하지만, 그로킹은 명백한 수렴 후에도 훈련을 계속하면 극적인 개선을 얻을 수 있음을 보여준다. 이는 계산 예산이 종종 제한되는 대규모 모델 훈련에 실질적인 시사점을 제공한다. 그로킹이 실제 작업에서 발생한다면 일부 모델이 과소 훈련되어 더 긴 훈련 실행의 혜택을 받을 수 있음을 의미할 수 있지만, 그로킹의 시작을 감지하는 것은 예측 불가능하고 과도한 계산이 필요할 수 있기 때문에 어렵다.

이 현상은 또한 신경망이 암기에서 일반화로 전환되는 방식을 연구하기 위한 테스트베드를 제공하며, 이는 대규모 언어 모델 및 기타 AI 시스템의 능력을 이해하는 데 관련이 있다. 연구자들은 그로킹과 대규모 모델에서 능력의 갑작스러운 출현 사이의 유사점을 그려왔지만, 그 관계는 여전히 추측에 불과하다. 그로킹을 이해하면 커리큘럼 학습이나 적응형 정규화와 같은 학습 가속화 기법에 정보를 제공하고, 더 안정적으로 일반화하는 모델을 설계하는 데 도움이 될 수 있다.

관련 현상 및 연구 방향

그로킹은 모델 크기가 커짐에 따라 테스트 성능이 먼저 개선되고, 악화되고, 다시 개선되는 "이중 하강(double descent)"과 같은 다른 관찰된 훈련 역학과 관련이 있다. 두 현상 모두 신경망 학습의 비단조적 특성을 강조한다. 그러나 그로킹은 모델 크기가 아닌 고정된 모델에 대해 시간이 지남에 따라 발생한다는 점에서 구별된다. 또 다른 관련 개념은 생물학적 시스템의 "결정적 학습 기간"으로, 특정 경험이 적절한 발달을 위해 특정 시기에 발생해야 하며, 일부 연구자들은 이를 그로킹 사건의 시기와 비교했다.

현재 연구 방향에는 더 큰 모델과 자연어 처리와 같은 더 복잡한 작업에서 그로킹을 조사하는 것이 포함되며, 여기서 증거는 엇갈린다. 일부 연구는 트랜스포머 기반 언어 모델에서 그로킹과 유사한 동작을 보고했지만, 다른 연구는 최적화 및 데이터 규모의 차이로 인해 관찰하지 못했다. 연구자들은 또한 초기화, 학습률 스케줄, 아키텍처 선택이 그로킹에 어떻게 영향을 미치는지 탐구하고 있으며, 예측 이론을 개발하는 것을 목표로 하고 있다. 2025년 현재 그로킹은 보편성, 메커니즘, 실용적 관련성에 대한 미해결 질문이 있는 활발한 연구 분야로 남아 있다.

같이 보기

참고 문헌

Power, A., Burda, Y., Edwards, H., Babuschkin, I., & Misra, V. (2022). Grokking: Generalization beyond overfitting on small algorithmic datasets. arXiv preprint arXiv:2201.02177.

Nanda, N., Chan, L., Lieberum, T., Smith, J., & Steinhardt, J. (2023). Progress measures for grokking via mechanistic interpretability. arXiv preprint arXiv:2301.05217.

Varma, V., Das, R., Schmidt, D., & Shah, N. (2023). Explaining grokking through circuit efficiency. arXiv preprint arXiv:2309.02390.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning·deep-learning·neural-networks·generalization
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사