원샷 학습은 Machine learning의 하위 분야로, 각 클래스당 단 하나의 예시만을 사용하여 모델을 훈련시켜 일반적으로 분류 또는 인식 작업을 수행하도록 하는 것에 관심을 둔다. 이는 제한된 수의 레이블된 인스턴스에서 모델이 일반화해야 하는 더 넓은 문제 설정인 퓨샷 학습의 극단적인 경우를 나타낸다. 대규모 데이터셋을 요구하는 기존 접근 방식과 대조적으로, 원샷 학습은 최소한의 노출로 새로운 개념을 학습하는 인간과 유사한 능력을 모방하는 것을 목표로 하며, 이는 Artificial intelligence 연구에서 핵심 과제가 된다.
이 개념은 2000년대와 2010년대에 Deep learning 및 Neural network 아키텍처의 발전에 힘입어 두각을 나타냈다. Fei-Fei Li 및 러스 살라쿠트디노프와 같은 연구자들은 원샷 학습을 위한 베이지안 및 확률적 모델에 대한 기초 작업을 기여했으며, 이후 개발은 Generative AI 및 Transformer (architecture) 모델을 활용하여 일반화를 개선했다. 원샷 학습은 의료 영상, 희귀 종 식별, 개인화된 사용자 인터페이스와 같이 데이터가 부족한 영역에서 특히 관련이 있다.
문제 공식화
일반적인 원샷 학습 설정에서 모델은 많은 클래스를 가진 기본 데이터셋으로 훈련된 후, 각각 단일 레이블된 예시로 표현되는 새로운 클래스 집합에 대해 평가된다. 목표는 이러한 보이지 않는 클래스의 새 인스턴스를 올바르게 분류하는 것이다. 이는 종종 N-way, K-shot 작업으로 공식화되며, 여기서 N은 클래스 수이고 K는 클래스당 예시 수이며, 원샷 학습은 K=1에 해당한다. 평가 지표에는 새로운 클래스에 대한 정확도와 다양한 작업 분포에 걸친 일반화 능력이 포함된다.
접근 방식 및 기술
여러 방법론적 계열이 원샷 학습을 다룬다. 메트릭 기반 방법은 동일한 클래스의 예시가 다른 클래스의 예시보다 더 가까운 임베딩 공간을 학습하며, 인기 있는 알고리즘으로는 시암 네트워크와 프로토타입 네트워크가 있다. 모델 기반 방법은 외부 메모리 또는 빠른 매개변수 적응을 사용하며, 메모리 증강 신경망 및 모델에 구애받지 않는 메타 학습(MAML)과 같은 메타 학습 접근 방식이 포함된다. 생성 방법은 추가 훈련 데이터를 합성하거나 주의 메커니즘과 같은 Neural network 구성 요소를 사용하여 예시를 직접 비교하는 방법을 학습한다. 최근 연구는 Large language model 및 Transformer (architecture) 아키텍처를 사용하여 자연어 및 다중 모달 설정에서 원샷 학습을 수행하는 것을 탐구했으며, 여기서 단일 프롬프트 또는 예시가 모델의 응답을 안내한다.
응용 분야
원샷 학습은 다양한 분야에서 실용적인 응용이 있다. Computer vision에서는 최소한의 레이블된 이미지로 객체 인식을 가능하게 하여 감시, 로봇 공학 및 증강 현실에 유용하다. 의료 영상에서는 주석이 달린 스캔이 부족한 희귀 질병 진단을 돕는다. 자연어 처리에서는 원샷 학습이 Large language model에서 퓨샷 프롬프팅을 지원하여 모델이 단일 지시 또는 예시로 새로운 작업을 수행할 수 있게 한다. 또한 Apple 및 Samsung Electronics 제품과 같은 소비자 기기에서 개인화를 지원하며, 여기서 사용자 특정 인식(예: 얼굴 또는 음성)은 제한된 등록 데이터로 작동해야 한다.
과제 및 한계
진전에도 불구하고 원샷 학습은 여전히 어렵다. 모델은 종종 높은 클래스 내 변동성과 낮은 클래스 간 구별 가능성으로 어려움을 겪어 과적합 또는 낮은 일반화로 이어진다. 충분한 데이터의 부족은 강력한 표현을 학습하기 어렵게 만들며, 많은 접근 방식은 세심한 하이퍼파라미터 튜닝 또는 대규모 사전 훈련 말뭉치를 요구한다. 또한 평가 프로토콜이 다양하여 연구 간 비교가 어렵다. 원샷 학습이 감시 또는 생체 인식 식별과 같은 민감한 영역에 적용될 때 윤리적 고려 사항이 발생하며, 여기서 오류는 중대한 결과를 초래할 수 있다.
향후 방향
진행 중인 연구는 샘플 효율성, 견고성 및 해석 가능성 개선에 초점을 맞추고 있다. Generative AI 및 Transformer (architecture) 모델과의 통합은 특히 다중 모달 작업에서 원샷 능력을 향상시킬 것으로 기대된다. MIT CSAIL, Stanford AI Lab 및 BAIR (Berkeley AI Research)와 같은 학술 기관과 OpenAI, Google DeepMind 및 Anthropic과 같은 산업 연구소 간의 협력은 계속해서 혁신을 주도하고 있다. Artificial intelligence 시스템이 더 널리 보급됨에 따라 원샷 학습은 적응형, 개인화 및 데이터 효율적인 지능을 가능하게 하는 데 중요한 역할을 할 것이다.