온라인 학습은 데이터가 순차적으로 제공되며 각 단계에서 미래 데이터에 대한 최적의 예측 변수를 업데이트하는 데 사용되는 머신 러닝 패러다임이다. 이는 전체 훈련 데이터 세트를 한 번에 처리하여 최종 모델을 생성하는 배치 학습과 대조된다. 온라인 학습은 전체 데이터 세트로 훈련하는 것이 계산적으로 불가능하여 외부 코어 알고리즘이 필요하거나, 금융 시장 가격이나 교통 패턴과 같이 시간의 함수로 데이터가 생성되는 경우에 특히 유용하다. 또한 알고리즘이 새로운 패턴에 동적으로 적응할 수 있게 하여 스폰서 검색, 포트폴리오 최적화, 스팸 필터링, 실시간 사기 탐지, 전자 상거래 동적 가격 책정과 같은 분야에서 일반적인 기법이 되었다. 온라인 학습 알고리즘은 치명적 간섭에 취약할 수 있으며, 이는 점진적 학습 접근 방식으로 완화할 수 있다. 초기 훈련 후 지속적이고 실시간 적응을 가능하게 하기 위해 온라인 학습 패러다임을 대규모 언어 모델에 적용하는 것에 대한 관심이 증가하고 있다.
온라인 학습의 통계적 관점
통계적 학습 프레임워크에서 목표는 결합 확률 분포 \( p(x, y) \)에서 추출된 인스턴스에 대해 잘 예측하는 함수 \( f: X \to Y \)를 학습하는 것이다. 학습자는 일반적으로 예시 \( (x_1, y_1), \ldots, (x_n, y_n) \)의 훈련 세트에 접근할 수 있으며, 손실 함수 \( V(f(x), y) \)는 예측 값과 실제 값의 차이를 측정한다. 이상적인 목표는 기대 위험 \( I[f] = \mathbb{E}[V(f(x), y)] \)을 최소화하는 것이다. 배치 학습에서는 경험적 위험 최소화 또는 정규화된 경험적 위험 최소화를 통해 이를 수행하며, 정규화된 최소 제곱법과 서포트 벡터 머신과 같은 알고리즘으로 이어진다. 그러나 순수 온라인 모델은 새 입력 \( (x_{t+1}, y_{t+1}) \), 현재 예측 변수 \( f_t \), 그리고 일부 추가 저장 정보만을 기반으로 예측 변수 \( f_t \)를 업데이트하며, 저장 요구 사항은 일반적으로 훈련 데이터 크기와 무관하다. 비선형 커널 방법과 같은 많은 공식화에서는 진정한 온라인 학습이 불가능하지만, \( f_{t+1} \)이 \( f_t \)와 모든 이전 데이터 포인트에 의존하는 재귀 알고리즘을 사용한 하이브리드 온라인 학습을 사용할 수 있다.
온라인 학습 알고리즘
온라인 학습 알고리즘은 각 새 데이터 포인트가 도착할 때마다 모델을 점진적으로 업데이트한다. 고전적인 예는 잘못 분류된 예시를 기반으로 가중치를 조정하는 퍼셉트론 알고리즘이다. 더 정교한 방법으로는 각 새 예시에 대한 손실의 음의 기울기 방향으로 모델 매개변수를 업데이트하는 온라인 경사 하강법이 있다. 이러한 알고리즘은 과적합을 방지하기 위해 정규화와 함께 자주 사용된다. 적대적 설정에서 온라인 학습은 학습자와 적대자 간의 게임으로 구성되며, 후회 최소화 전략으로 이어진다. 이 분야는 머신 러닝의 이론적 기초에 기여한 토마스 디테리히와 마이클 조던과 같은 연구자들의 영향을 받았다.
실세계 시스템에서의 응용
온라인 학습은 실시간 의사 결정이 필요한 시스템에서 널리 적용된다. 예를 들어, 스폰서 검색에서 온라인 알고리즘은 사용자 클릭을 기반으로 입찰가를 조정하여 광고 수익을 극대화한다. 포트폴리오 최적화에서는 변화하는 시장 조건에 적응한다. 지도 앱의 교통 인식 라우팅과 같은 최단 경로 예측은 확률적 가중치를 처리하기 위해 온라인 학습을 사용한다. 스팸 필터링과 실시간 사기 탐지는 새로운 패턴이 나타날 때 모델을 업데이트하는 능력의 이점을 얻는다. 전자 상거래 플랫폼의 동적 가격 책정도 수요와 경쟁에 따라 가격을 조정하기 위해 온라인 학습에 의존한다. 이러한 응용은 종종 대규모 데이터 스트림을 포함하므로 온라인 학습이 실용적인 선택이 된다.
온라인 학습과 대규모 언어 모델
초기 훈련 후 지속적인 적응을 가능하게 하기 위해 온라인 학습을 대규모 언어 모델에 적용하는 것에 대한 관심이 증가하고 있다. 이는 OpenAI와 Anthropic이 개발한 모델과 같이 대규모 데이터 세트로 훈련되었지만 시간이 지남에 따라 새로운 정보를 통합해야 할 수 있는 모델에 특히 관련이 있다. 온라인 학습 패러다임은 이러한 모델이 전체 재훈련 없이 지식을 업데이트할 수 있게 하여 계산 비용을 줄일 수 있다. 그러나 치명적 망각과 안정성-가소성 균형과 같은 과제는 여전히 활발한 연구 영역이다. 트랜스포머 아키텍처에 기여한 야코프 우슈코레이트와 루카스 카이저와 같은 연구자들은 모델을 더 적응적으로 만드는 방법을 탐구했다.
과제와 미래 방향
온라인 학습의 주요 과제 중 하나는 새로운 정보가 이전에 학습된 지식을 덮어쓰는 치명적 간섭이다. 점진적 학습 접근 방식은 중요한 패턴을 보존하여 이를 해결하는 것을 목표로 한다. 또 다른 과제는 특히 적대적 설정에서 탐험과 활용 간의 균형이다. 미래 방향에는 딥 러닝과 신경망에 사용되는 것과 같은 딥 러닝 모델을 위한 더 효율적인 온라인 알고리즘 개발이 포함된다. 온라인 학습과 생성형 AI 시스템의 통합도 실시간 콘텐츠 생성 및 대화형 AI에서 잠재적 응용과 함께 새로운 영역으로 떠오르고 있다. 데이터의 양과 속도가 계속 증가함에 따라 온라인 학습은 머신 러닝 시스템에서 점점 더 중요한 역할을 할 것이다.