모델-불가지론 메타 학습(MAML)은 2017년 캘리포니아 대학교 버클리에서 Chelsea Finn, Pieter Abbeel, Sergey Levine이 소개한 메타 학습 알고리즘이다. 이는 모델이 소수의 레이블된 예제만으로 새로운 작업에 빠르게 적응해야 하는 퓨샷 학습 문제를 해결한다. MAML의 핵심 아이디어는 새로운 작업에 대한 소수의 경사 하강 단계가 좋은 성능으로 이어지도록 위치한 모델 매개변수의 초기화를 학습하는 것이다. 이 접근 방식은 모델-불가지론적이며, 경사 하강으로 훈련된 모든 모델에 적용할 수 있다. 여기에는 신경망 및 기타 미분 가능한 아키텍처가 포함된다.
이 알고리즘은 두 개의 중첩 루프에서 작동한다. 내부 루프에서는 작업 분포에서 샘플링된 각 작업에 대해 모델이 작업의 훈련 데이터에 대해 하나 이상의 경사 단계를 수행하여 작업별 매개변수를 생성한다. 외부 루프에서는 작업별 매개변수를 사용하여 작업의 테스트 데이터에서 계산된 손실을 최소화하도록 모델의 초기 매개변수가 업데이트된다. 이 메타 목적 함수는 손실의 초기 매개변수에 대한 민감도를 효과적으로 최적화하여 모델이 경사 하강이 특히 효과적인 매개변수 공간의 영역에 있도록 장려한다. MAML은 새로운 매개변수를 도입하거나 모델 아키텍처를 수정하지 않으므로 기존 Machine learning 프레임워크 위에 구현하기 간단하다.
수학적 공식화
공식적으로, θ로 매개변수화된 모델 f_θ를 고려한다. 작업 분포 p(T)가 주어지면 각 작업 T는 훈련 세트 D_tr과 테스트 세트 D_te를 가진다. 작업 T에 대해 내부 루프는 훈련 손실 L_T에 대한 k개의 경사 하강 단계를 사용하여 적응된 매개변수 θ'_T를 계산한다:
θ'_T = θ - α ∇_θ L_T(f_θ, D_tr)
여기서 α는 내부 학습률이다. 외부 루프는 작업 간 테스트 세트의 기대 손실을 최소화하도록 초기 매개변수 θ를 최적화한다:
min_θ Σ_T L_T(f_θ'_T, D_te)
이 메타 목적 함수는 내부 루프 업데이트를 통한 2차 도함수를 요구하는 경사 하강을 통해 최적화된다. 저자들은 또한 이러한 2차 항을 무시하는 1차 근사(FOMAML)를 제안했으며, 이는 실제로 거의 동일한 성능을 보이면서 계산 비용이 더 저렴하다.
퓨샷 학습에서의 응용
MAML은 퓨샷 분류 및 회귀 벤치마크에서 광범위하게 평가되었다. 원래 논문에서 저자들은 50개 알파벳의 1,623개 손글씨 문자 데이터셋인 Omniglot과 100개 클래스의 ImageNet 하위 집합인 MiniImageNet에서 테스트했다. Omniglot에서 5-way 1-shot 분류의 경우 MAML은 98.7%의 정확도를 달성했으며, MiniImageNet에서는 5-way 1-shot에서 48.7%, 5-way 5-shot에서 63.1%에 도달했다. 이러한 결과는 매칭 네트워크 및 프로토타입 네트워크와 같은 동시대 방법과 경쟁력이 있거나 우수했다. MAML은 또한 다양한 진폭과 위상을 가진 사인 함수 피팅을 포함한 퓨샷 회귀 작업에서 효과를 입증했으며, 단 10개의 데이터 포인트에서 새로운 함수에 적응할 수 있었다.
확장 및 변형
MAML의 한계를 해결하기 위해 여러 확장이 제안되었다. 2018년 OpenAI의 Alex Nichol과 Joshua Achiam이 소개한 Reptile은 2차 경사를 계산하지 않고 각 작업 후 초기 매개변수를 작업별 매개변수 쪽으로 업데이트하여 외부 루프를 단순화한다. 이는 계산 비용을 줄이면서도 비교 가능한 성능을 달성한다. 또 다른 변형인 확률적 MAML(ProMPL)은 작업 간 불확실성을 포착하기 위해 초기 매개변수를 분포로 모델링한다. Zhenguo Li와 동료들이 제안한 Meta-SGD는 초기화와 매개변수별 학습률을 모두 학습하여 비등방성 업데이트를 가능하게 한다. 또한 MAML은 Curriculum Learning과 결합되어 메타 훈련 중 작업을 난이도 순으로 정렬하여 수렴과 최종 성능을 개선했다.
전이 학습 및 사전 훈련과의 관계
MAML은 모델이 대규모 데이터셋에서 사전 훈련된 후 새 작업에 미세 조정되는 표준 전이 학습과 자주 비교된다. 전이 학습에서 사전 훈련된 매개변수는 단일 소스 작업에 대해 최적화되는 반면, MAML은 작업 분포에 대해 최적화하여 모델이 적응 가능하도록 명시적으로 장려한다. 이러한 구분은 다양한 텍스트 코퍼스에서 사전 훈련 후 특정 작업에 미세 조정하는 것이 일반적인 대규모 언어 모델의 맥락에서 특히 관련이 있다. MAML의 학습 학습 원리는 이 과정의 메타 수준 버전으로 볼 수 있으며, 목표는 필요한 미세 조정 단계 수를 최소화하는 것이다. 그러나 MAML은 일반적으로 더 작은 모델과 명확한 작업 경계가 있는 작업에 적용되는 반면, 현대 Deep learning 사전 훈련은 종종 대규모 데이터셋과 작업-불가지론적 목표를 사용한다.
계산 고려 사항
MAML의 주요 단점은 계산 비용이다. 내부 루프는 각 작업에 대한 경사를 계산해야 하며, 외부 루프는 메모리 집약적인 2차 경사를 요구한다. 수백만 개의 매개변수를 가진 모델의 경우 이는 금지적일 수 있다. 1차 근사 FOMAML은 이를 1차 경사로 줄이지만 여전히 작업당 여러 번의 순방향 및 역방향 패스가 필요하다. 이를 완화하기 위해 내부 단계 수를 줄이거나(종종 1 또는 5) Gradient Clipping을 사용하여 훈련을 안정화하는 등 여러 기술이 개발되었다. 실제로 MAML은 종종 몇 개의 레이어를 가진 작은 컨볼루션 네트워크나 잔차 네트워크에 적용되며, 매우 큰 모델에는 적용되지 않는다. 알고리즘의 모델-불가지론적 특성은 선형 회귀나 서포트 벡터 머신과 같은 비신경 모델에도 적용할 수 있지만, 경사 기반 요구 사항이 범위를 제한한다.
영향 및 파급 효과
MAML은 메타 학습 분야에 상당한 영향을 미쳤으며, 많은 후속 연구를 고무했다. 수천 번 인용되었고 퓨샷 학습 연구의 표준 기준선이 되었다. 초기화 학습 아이디어는 강화 학습을 포함한 다른 영역으로 확장되었으며, 여기서 MAML은 에이전트가 새로운 환경에 빠르게 적응할 수 있도록 하는 데 사용되었다. Artificial intelligence 연구에서 MAML은 메모리 증강 네트워크 및 메트릭 기반 방법과 같은 다른 접근 방식과 함께 메타 학습의 표준 예로 자주 가르쳐진다. 그 영향은 새로운 물리적 조건에 대한 빠른 적응이 중요한 로봇 공학과 제한된 데이터로 개별 사용자에게 적응해야 하는 개인화된 Machine learning 시스템의 실제 응용으로 확장된다.
한계 및 비판
성공에도 불구하고 MAML에는 여러 한계가 있다. 단일 초기화가 분포의 모든 작업에 제공될 수 있다는 가정은 매우 다양한 작업 세트에는 적용되지 않을 수 있다. 알고리즘은 내부 학습률과 내부 단계 수의 선택에 민감하며, 이는 종종 튜닝이 필요하다. 또한 MAML의 성능은 작업 분포가 매끄럽지 않거나 작업이 서로 매우 다른 경우 저하된다. 일부 연구자들은 좋은 정규화 체계로 사전 훈련된 모델을 미세 조정하는 것과 같은 더 간단한 기준선이 특정 벤치마크에서 MAML의 성능과 일치할 수 있다고 주장했다. 계산 비용은 또한 매우 큰 모델로의 확장성을 제한하며, 이는 Deep learning 모델이 더 커짐에 따라 증가하는 우려 사항이다. 그럼에도 불구하고 MAML은 효율적으로 학습하는 알고리즘을 설계하는 방법에 대한 이해를 형성한 기초적인 기여로 남아 있다.
현재 연구 방향
최근 연구는 MAML을 트랜스포머 및 기타 현대 아키텍처와 결합하는 것을 탐구했다. 예를 들어, 일부 연구는 퓨샷 텍스트 분류를 위해 트랜스포머 기반 모델의 초기화를 메타 학습하는 데 MAML을 적용했지만 계산 비용은 여전히 과제로 남아 있다. 다른 연구는 불확실성 추정이나 베이지안 추론과 같은 기술을 사용하여 MAML을 작업 분포 변화에 더 강건하게 만드는 데 초점을 맞춘다. 또한 이전 작업을 잊지 않고 일련의 작업에 적응해야 하는 지속 학습에 MAML을 사용하는 데 관심이 있다. 2020년대 초반 현재 MAML은 여전히 활발한 연구 영역이며, 새로운 변형과 이론적 분석이 정기적으로 등장한다. 그 원리는 또한 Generative AI 및 적응형 시스템의 더 넓은 프레임워크에 통합되고 있으며, 여기서 새로운 사용자 요구에 빠르게 적응하는 능력이 점점 더 중요해지고 있다.
결론
모델-불가지론 메타 학습은 메타 학습 알고리즘 개발의 핵심 이정표를 나타낸다. 빠른 적응을 가능하게 하는 초기 매개변수 학습에 초점을 맞춤으로써 MAML은 다양한 모델과 작업에 적용할 수 있는 간단하면서도 강력한 프레임워크를 제공한다. 그 도입은 확장과 응용의 풍부한 생태계를 촉발했으며, 그 아이디어는 퓨샷 학습, 강화 학습 및 그 너머의 연구에 계속 영향을 미치고 있다. 계산적 과제와 한계가 남아 있지만, MAML의 개념적 기여 - 학습의 목표가 학습 방법을 배우는 것일 수 있다는 것 - 는 현대 Artificial intelligence 연구의 중심 주제가 되었다.