분포 이동(distribution shift)은 머신러닝 모델이 배포 중에 마주치는 데이터의 통계적 속성이 학습에 사용된 데이터의 속성과 다르게 되는 현상을 말한다. 이러한 불일치는 모델이 학습한 패턴이 더 이상 실제 입력과 일치하지 않게 되면서 모델 성능의 상당한 저하를 초래할 수 있다. 이는 머신러닝과 인공지능의 근본적인 문제로, 이미지 분류기부터 대규모 언어 모델에 이르는 시스템에 영향을 미친다.
분포 이동은 단일 문제가 아니라 각각 고유한 원인과 완화 전략을 가진 관련 과제들의 집합이다. 이러한 변형들을 이해하는 것은 시간이 지나고 다양한 환경에서 정확성을 유지하는 견고한 시스템을 구축하는 데 중요하다. AI 시스템이 통제된 연구 환경에서 역동적인 실제 응용 분야로 이동함에 따라 이 분야의 중요성은 커지고 있다.
분포 이동의 유형
분포 이동은 일반적으로 결합 확률 분포의 어느 부분이 변하는지에 따라 여러 유형으로 분류된다. 가장 자주 인용되는 분류 체계에는 공변량 이동, 레이블 이동, 개념 드리프트가 포함된다.
공변량 이동은 입력 특성의 분포인 P(X)가 변하는 반면, 입력이 주어졌을 때 레이블의 조건부 분포인 P(Y|X)는 동일하게 유지되는 경우 발생한다. 예를 들어, 주간 거리 장면으로 학습된 모델이 배포 중 야간 이미지를 마주칠 수 있는데, 픽셀 값의 분포는 변하지만 자동차의 외관과 '자동차'라는 레이블 사이의 관계는 일정하게 유지된다.
레이블 이동(사전 확률 이동이라고도 함)은 P(Y)가 변하지만 P(X|Y)가 변하지 않는 경우 발생한다. 의료 진단에서 인구 내 질병의 유병률이 변하면, 질병과 관련된 증상이 동일하더라도 모델의 예측이 잘못 보정될 수 있다.
개념 드리프트는 조건부 관계 P(Y|X) 자체의 변화를 의미한다. 이는 금융 시장이나 사용자 행동과 같은 역동적인 환경에서 자주 발생하며, 데이터를 지배하는 기본 규칙이 시간이 지남에 따라 진화한다. 예를 들어, 2020년 이메일로 학습된 스팸 필터는 스패머가 전술을 변경했기 때문에 2024년 이메일에서는 실패할 수 있다.
다른 관련 형태로는 데이터 생성 과정의 모든 변화를 포괄하는 더 넓은 용어인 데이터셋 이동과, 소스 도메인에서 다른 대상 도메인으로 지식을 전달하는 것을 구체적으로 다루는 도메인 적응이 있다.
원인과 실제 사례
분포 이동은 종종 결합된 여러 원인에서 발생한다. 주요 원인 중 하나는 시간적 드리프트로, 기술, 사회 또는 자연 과정의 변화로 인해 데이터가 시간이 지남에 따라 진화한다. 2018년 사용자 선호도로 학습된 추천 시스템은 취향이 변함에 따라 2024년에는 성능이 저하될 가능성이 높다.
지리적 또는 인구통계학적 이동은 모델이 학습 데이터와 다른 지역이나 인구에 배포될 때 발생한다. 주로 한 민족으로 학습된 얼굴 인식 시스템은 다른 집단에서 더 높은 오류율을 보일 수 있으며, 이는 버클리 AI 연구 및 다른 기관의 연구에서 문서화된 문제이다.
센서 또는 측정 이동은 데이터 수집 장치가 변경될 때 발생한다. 한 카메라 모델의 이미지로 학습된 모델은 색상 응답, 해상도 또는 노이즈 특성의 차이로 인해 다른 카메라로 배포될 때 실패할 수 있다. 이는 웨이모와 테슬라 오토파일럿이 다양한 센서 구성을 처리해야 하는 자율 주행에서 특히 관련이 있다.
적대적 이동은 악의적인 행위자에 의해 의도적으로 유도된다. 스팸 필터, 사기 탐지 시스템 및 사이버 보안 도구는 탐지를 회피하기 위해 행동을 적극적으로 수정하는 적대자에 직면한다. 이는 모델 개발자와 공격자 사이의 지속적인 군비 경쟁을 만든다.
학습 데이터의 선택 편향도 이동을 유발할 수 있다. 자발적 설문 조사나 병원 기록과 같은 비대표적 과정을 통해 학습 데이터가 수집되면, 모델은 더 넓은 인구에 일반화되지 않는 패턴을 학습할 수 있다.
모델 성능에 미치는 영향
분포 이동의 결과는 심각할 수 있다. 모델은 극적인 정확도 하락을 경험하거나, 자신 있게 잘못된 예측을 생성하거나, 안전이 중요한 응용 분야에서 조용히 실패할 수 있다. 의료 영상에서 한 병원의 장비로 학습된 모델은 다른 병원에서 환자를 오진할 수 있다. 금융에서 거래 알고리즘은 학습에서 보지 못한 시장 상황에서 잘못된 결정을 내릴 수 있다.
연구에 따르면 작은 이동조차도 상당한 성능 저하를 유발할 수 있다. 알렉산더 매드리와 동료들의 2019년 연구는 표준 이미지 분류기가 조명, 회전 및 배경의 자연스러운 변화에 매우 민감하다는 것을 입증했다. 이러한 취약성은 벤치마크 성능과 실제 견고성 사이의 격차를 강조한다.
딥러닝 모델의 경우, 문제는 종종 허위 상관관계에 집착하는 경향으로 인해 악화된다. 늑대를 식별하도록 학습된 모델은 동물 자체보다 배경의 눈에 의존할 수 있으며, 눈이 없는 환경에 배포될 때 실패로 이어진다.
탐지 및 측정
분포 이동을 탐지하는 것은 이를 해결하는 첫 번째 중요한 단계이다. 모델의 입력 분포가 변경되었는지 식별하기 위해 여러 통계 기법이 사용된다.
이중 표본 검정 방법(콜모고로프-스미르노프 검정 또는 최대 평균 불일치(MMD) 등)은 학습 및 배포 특성 분포를 비교한다. 유의미한 차이가 감지되면 이동이 존재할 가능성이 높다.
예측 신뢰도 모니터링은 더 간단한 접근 방식이다. 모델의 평균 신뢰도가 떨어지거나 예측 분포가 변하면 이동을 나타낼 수 있다. 그러나 신경망은 종종 보정이 제대로 되어 있지 않아 온도 스케일링과 같은 추가 보정 기술 없이는 이 방법이 신뢰할 수 없다.
배포 데이터의 레이블이 지정된 하위 집합에 대한 오류율 모니터링은 성능 저하의 직접적인 측정을 제공하지만, 비용이 많이 들거나 지연될 수 있는 실제 레이블이 필요하다.
아마존 웹 서비스, 애저 및 구글 클라우드를 포함한 현대 MLOps 플랫폼은 프로덕션 모델의 이동을 감지하기 위한 내장 모니터링 도구를 점점 더 제공하고 있다.
완화 전략
분포 이동의 영향을 완화하기 위해 다양한 기술이 개발되었다. 이는 데이터 수준 개입부터 알고리즘 수정 및 지속적 학습 접근 방식에 이르기까지 다양하다.
도메인 적응은 소스와 대상 분포를 정렬하는 것을 목표로 한다. 이는 대상 분포와 일치하도록 학습 샘플의 가중치를 다시 조정하거나, 적대적 학습을 통해 도메인 불변 특성을 학습함으로써 수행될 수 있다. 스탠포드 AI 연구소와 MIT CSAIL의 연구로 대중화된 후자의 접근 방식은 판별기를 사용하여 특성 추출기가 도메인 간에 구별할 수 없는 표현을 생성하도록 장려한다.
데이터 증강은 간단하면서도 효과적인 방법이다. 예상되는 이동을 시뮬레이션하는 변환으로 학습 데이터를 인위적으로 확장함으로써 모델은 더 견고해질 수 있다. 이미지의 경우 회전, 색상 지터 및 자르기가 포함된다. 텍스트의 경우 동의어 대체 또는 역번역이 포함될 수 있다.
견고한 최적화 기술(분포적으로 견고한 최적화(DRO) 등)은 단일 분포가 아닌 가능한 분포 집합에서 잘 수행되도록 모델을 학습시킨다. 존 두치와 피터 리앙과 같은 연구자들이 연구한 이 접근 방식은 학습 분포 주변의 불확실성 집합에 대한 최악의 손실을 최소화한다.
지속적 학습(평생 학습이라고도 함)은 새로운 데이터가 도착할 때 모델이 업데이트될 수 있도록 한다. 이는 새 데이터에 대한 미세 조정을 통해 수행될 수 있지만, 이전에 학습된 작업에서 모델이 성능을 잃는 파괴적 망각을 피하기 위해 신중한 처리가 필요하다. 탄성 가중치 통합 및 경험 재생과 같은 기술이 이 문제를 해결한다.
테스트 시간 적응은 재학습 없이 추론 중에 모델을 조정한다. 배치 정규화 통계 업데이트 또는 레이블이 없는 테스트 데이터에 대한 엔트로피 최소화와 같은 방법은 모델이 이동에 즉시 적응하도록 도울 수 있다.
이론적 관점
분포 이동은 통계 및 학습 이론에 깊은 이론적 뿌리를 두고 있다. 고전적인 PAC 학습 프레임워크는 학습 및 테스트 데이터가 동일한 분포에서 온다고 가정한다. 이 가정이 위반되면 전통적인 일반화 경계는 더 이상 적용되지 않는다.
연구자들은 이동 하에서의 학습을 분석하기 위한 새로운 이론적 프레임워크를 개발했다. 샤이 벤-데이비드와 동료들이 도입한 R-발산 개념은 두 분포 사이의 불일치를 측정하고 소스 도메인 오류에 이 발산을 더한 값으로 대상 도메인 오류에 대한 경계를 제공한다.
또 다른 중요한 아이디어는 불변성 원리로, 모델이 환경 전반에 걸쳐 레이블과의 관계가 안정적인 특성에 의존해야 한다고 제안한다. 이는 여러 학습 환경에서 최적의 예측 변수를 학습하려는 불변 위험 최소화(IRM)와 같은 방법으로 이어졌다.
알리 라히미의 머신러닝의 '숨겨진 기술 부채'에 대한 연구는 분포 이동이 배포된 ML 시스템의 유지 관리 부담의 주요 원인 중 하나임을 강조했다. 2017년 NIPS에서의 그의 강연은 프로덕션의 모델이 효과적으로 유지되기 위해 지속적인 모니터링과 업데이트가 필요하다는 점을 강조했다.
현재 연구 및 미래 방향
분포 이동은 여전히 활발한 연구 분야이다. 버클리 AI 연구 그룹은 다른 그룹과 함께 견고성 방법을 평가하기 위한 현실적인 이동이 있는 데이터셋을 제공하는 WILDS와 같은 벤치마크를 조직했다. 이러한 벤치마크는 제안된 많은 알고리즘이 실제 이동에서 단순한 기준선보다 개선되지 못한다는 것을 밝혀냈다.
기반 모델, 특히 대규모 언어 모델과 다중 모달 모델은 새로운 도전과 기회를 제시한다. 그들의 방대한 규모와 다양한 학습 데이터는 이동에 대한 일부 고유한 견고성을 부여할 수 있지만, 분포 외 프롬프트에 직면했을 때 환각과 같은 새로운 실패 모드를 도입한다.
추론 중에 모델이 자체 매개변수를 업데이트하는 테스트 시간 학습에 대한 연구가 주목을 받고 있다. 유에 자오와 다른 사람들이 탐구한 이 접근 방식은 레이블이 없는 데이터로 이동에 적응하는 데 유망함을 보여준다.
또 다른 최전선은 이동에 대한 인과적 접근 방식이다. 단순한 상관관계보다 인과 구조를 학습함으로써 모델은 개입 및 분포 변화에 더 잘 일반화할 수 있다. 베른하르트 쇨코프와 요나스 페터스와 같은 연구자들은 인과 모델이 불변하는 기본 메커니즘을 포착하기 때문에 이동에 더 견고하다고 주장했다.
실무자를 위한 실용적 고려 사항
ML 시스템을 배포하는 엔지니어에게 분포 이동을 해결하려면 사전 예방적 접근 방식이 필요하다. 주요 관행은 다음과 같다:
- 지속적 모니터링: 프로덕션에서 입력 분포와 모델 성능 지표를 추적한다.
- 버전 관리 데이터: 디버깅을 용이하게 하기 위해 학습 데이터와 모델 버전의 명확한 기록을 유지한다.
- 피드백 루프: 주기적 재학습을 위해 배포에서 레이블이 지정된 데이터를 수집하는 시스템을 구현한다.
- 보수적 배포: 고위험 결정에 인간 개입 검토와 같은 기술을 사용한다.
- 앙상블 방법: 다른 데이터 조각으로 학습된 여러 모델을 결합하여 견고성을 개선한다.
오픈AI, 앤트로픽 및 구글 딥마인드와 같은 회사는 배포된 모델이 다양하고 진화하는 사용자 입력에 직면하기 때문에 견고성 연구에 많은 투자를 하고 있다. 이동의 경제적 비용은 상당하며, 모델은 성능을 유지하기 위해 빈번한 업데이트가 필요하다.
결론적으로, 분포 이동은 머신러닝을 실제 세계에 적용하는 데 있어 내재된 도전 과제이다. 단일 해결책은 없지만, 탐지, 완화 및 지속적 학습 전략의 조합은 데이터가 변함에도 불구하고 신뢰할 수 있는 시스템을 구축하는 데 도움이 될 수 있다. AI 시스템이 더 보편화됨에 따라 분포 이동을 이해하고 관리하는 것의 중요성은 더욱 커질 것이다.