견습 학습(apprenticeship learning)은 기계 학습의 하위 분야로, 명시적인 보상 신호나 수작업으로 만든 지시를 받는 대신 전문가의 시연을 관찰하여 에이전트가 작업을 수행하도록 가르치는 것에 관한 것입니다. 이 용어는 2004년 Pieter Abbeel과 Andrew Ng의 기초 연구에서 대중화되었으며, 그들은 이 문제를 마르코프 결정 과정(MDP)에서 전문가의 특징 기대값과 일치하는 정책을 학습하는 문제로 정의했습니다. 전문가의 행동을 직접 복사하는 표준 지도 모방 학습과 달리, 견습 학습은 일반적으로 전문가의 행동을 동기화하는 기본 보상 함수를 추론하려고 하며, 이는 역강화 학습으로도 알려져 있습니다. 이 접근 방식은 에이전트가 시연된 상태를 넘어 일반화할 수 있고, 최적 행동이 단순히 관찰에서 행동으로의 직접적인 매핑이 아닌 상황을 처리할 수 있게 합니다.
핵심 아이디어는 전문가의 행동이 알려지지 않은 어떤 보상 함수에 대해 최적(또는 거의 최적)이라고 가정한다는 것입니다. 학습자의 목표는 기대 누적 보상으로 측정했을 때 전문가만큼 잘 수행하는 정책을 찾는 것입니다. 실제 보상이 알려지지 않았기 때문에 학습자는 시연에서 이를 추정해야 합니다. Abbeel과 Ng는 보상 함수가 알려진 특징의 선형 조합이라면, 전문가 정책의 특징 기대값을 일치시키는 것이 보상 함수의 특정 가중치와 관계없이 학습자 정책이 전문가만큼 거의 잘 수행함을 보장하기에 충분하다는 것을 보여주었습니다. 이 통찰력은 많은 견습 학습 알고리즘의 기초를 형성합니다.
공식 프레임워크
견습 학습은 일반적으로 상태, 행동, 전이 확률, 할인 요인의 집합으로 정의되는 마르코프 결정 과정(MDP) 프레임워크 내에서 공식화됩니다. 표준 설정에서 보상 함수는 학습자에게 알려지지 않습니다. 전문가는 상태와 행동의 시퀀스인 일련의 궤적을 제공합니다. 학습자는 알려지지 않은 보상 하에서 기대 수익을 최대화하는 정책을 계산해야 합니다.
핵심 수학적 도구는 특징 기대값의 개념입니다. 주어진 정책에 대해 특징 기대값은 궤적을 따라 만난 특징 벡터의 기대 할인 합입니다. 학습자 정책의 특징 기대값을 전문가 정책의 것과 일치시킴으로써, 학습자는 전문가가 최적화했을 수 있는 모든 선형 보상 함수 하에서 자신의 정책이 최적에 가깝다는 것을 보장합니다. 이는 학습자가 정확한 보상 가중치를 식별할 필요가 없기 때문에 강력한 보장입니다.
역강화 학습과의 관계
견습 학습은 역강화 학습(IRL)과 밀접한 관련이 있으며, 이는 전문가 시연에서 보상 함수를 복구하는 문제입니다. IRL에서 목표는 보상 함수를 명시적으로 추정하는 반면, 견습 학습에서 목표는 잘 수행하는 정책을 직접 생성하는 것입니다. 많은 견습 학습 알고리즘은 IRL 문제를 반복적으로 해결한 다음 추정된 보상을 사용하여 정책을 훈련하는 방식으로 작동합니다. 이 반복 과정은 종종 '견습 학습 알고리즘'이라고 불리며 2004년 논문에서 소개되었습니다. 이 알고리즘은 현재 보상 추정치를 최대화하는 정책을 찾는 것과 전문가의 행동이 더 최적으로 보이도록 보상 추정치를 업데이트하는 것을 번갈아 수행합니다.
알고리즘 및 방법
견습 학습을 위해 여러 알고리즘이 개발되었습니다. Abbeel과 Ng의 원래 알고리즘은 선형 계획법 접근 방식을 사용하여 전문가의 특징 기대값과 일치하는 정책을 찾습니다. 이후 연구는 최대 엔트로피 IRL과 같은 기술을 사용하여 비선형 보상 함수로 확장했으며, 이는 전문가의 행동을 확률적으로 모델링하고 특징 기대값 일치를 조건으로 정책의 엔트로피를 최대화합니다. 또 다른 인기 있는 접근 방식은 생성적 적대 신경망(GAN)을 생성적 적대 모방 학습(GAIL) 형태로 사용하는 것으로, 보상 함수를 명시적으로 복구하지 않고 전문가의 상태-행동 분포를 모방하는 정책을 직접 학습합니다.
더 최근 방법은 이미지와 같은 고차원 상태 공간을 처리하기 위해 딥러닝과 신경망 아키텍처를 활용합니다. 이러한 방법은 종종 견습 학습을 딥러닝 기술과 결합하여 에이전트가 원시 픽셀 입력에서 학습할 수 있게 합니다. 예를 들어, 로봇 조작 작업에서 딥 견습 학습 알고리즘은 인간 시연자를 관찰하고 합성곱 신경망을 사용하여 시각 입력을 처리함으로써 물체를 잡는 방법을 학습할 수 있습니다.
응용 분야
견습 학습은 다양한 분야에 적용되었습니다. 로봇 공학에서는 운전, 비행, 조작과 같은 작업을 로봇에게 가르치는 데 사용되었습니다. 예를 들어, Waymo와 Tesla은 전문가가 인간 운전자인 자율 주행을 위한 모방 학습 기술을 탐구했습니다. 게임 플레이에서는 견습 학습이 전문가의 수를 관찰하여 체스와 바둑 같은 게임을 플레이하도록 에이전트를 훈련하는 데 사용되었지만, 현대 접근 방식은 종종 이를 강화 학습과 결합합니다. 자연어 처리에서는 견습 학습이 대화 시스템에 적용되어 에이전트가 인간 대화를 모방하여 대화하는 법을 배우고, 요약 작업에도 적용되었습니다.
의료 분야에서는 견습 학습이 임상 의사 결정을 모델링하는 데 사용되었습니다. 예를 들어, 에이전트는 경험 많은 의사의 결정을 관찰하여 치료를 추천하는 법을 배울 수 있습니다. 이는 개인 맞춤 의학과 같이 보상 함수를 지정하기 어려운 분야에서 특히 유용합니다. 금융에서는 성공적인 트레이더가 전문가이고 에이전트가 그들의 전략을 복제하는 법을 배우는 알고리즘 거래에 적용되었습니다.
과제 및 한계
견습 학습의 주요 과제 중 하나는 많은 수의 전문가 시연이 필요하다는 것입니다. 전문가의 행동은 노이즈가 있거나 최적이 아닐 수 있으며, 이는 학습 결과가 좋지 않을 수 있습니다. 또한 전문가가 선형 보상 함수를 최적화한다는 가정은 많은 실제 시나리오에서 너무 제한적일 수 있습니다. 실제 보상이 비선형일 때 특징 기대값 일치는 좋은 성능을 보장하기에 충분하지 않을 수 있습니다.
또 다른 과제는 분포 이동의 문제입니다. 학습자의 정책은 전문가 시연에 포함되지 않은 상태를 방문할 수 있어 예측할 수 없는 행동을 초래할 수 있습니다. 이는 전문가의 범위가 희소한 고차원 상태 공간에서 특히 문제가 됩니다. 데이터 증강과 도메인 무작위화와 같은 기술이 이 문제를 완화하기 위해 제안되었지만 항상 효과적인 것은 아닙니다.
또한 견습 학습은 특징 선택에 민감합니다. 특징은 작업의 관련 측면을 포착할 만큼 충분히 정보적이어야 하지만, 특징 기대값 일치가 계산적으로 불가능해질 정도로 고차원적이어서는 안 됩니다. 실제로 좋은 특징을 설계하려면 종종 도메인 전문 지식이 필요합니다.
다른 학습 패러다임과의 비교
견습 학습은 종종 커리큘럼 학습 및 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습)와 같은 다른 패러다임과 비교됩니다. 커리큘럼 학습에서 에이전트는 점진적으로 더 어려운 작업에 대해 훈련되며, 이는 학습 효율성을 개선하는 다른 접근 방식입니다. 대조적으로 견습 학습은 전문가 시연에서 학습하는 데 초점을 맞춥니다. 인간 피드백 기반 강화 학습(RLHF)은 대규모 언어 모델 훈련에 사용되며 관련이 있지만 구별됩니다. RLHF는 인간 선호도를 사용하여 보상 모델을 형성하는 반면, 견습 학습은 시연을 직접 사용합니다. 그러나 두 방법 모두 에이전트 행동을 인간 의도와 일치시키는 것을 목표로 합니다.
또 다른 관련 개념은 행동 복제(behavioral cloning)로, 에이전트가 지도 학습을 사용하여 상태에서 행동으로의 직접 매핑을 학습하는 간단한 형태의 모방 학습입니다. 행동 복제는 구현하기 쉽지만 분포 이동으로 어려움을 겪고 전문가 시연을 넘어 일반화할 수 없습니다. 견습 학습은 보상을 추론함으로써 잠재적으로 더 잘 일반화할 수 있습니다.
최근 발전
견습 학습의 최근 발전은 딥러닝 및 대규모 컴퓨팅과의 통합에 의해 주도되었습니다. 예를 들어, OpenAI와 Google DeepMind는 견습 학습을 강화 학습과 결합하여 복잡한 환경에서 초인간적 성능을 달성하는 알고리즘을 개발했습니다. 생성형 AI의 맥락에서 견습 학습은 RLHF와 유사하지만 선호도 대신 시연을 사용하여 모델을 인간 가치와 정렬하는 데 사용되었습니다.
또한 여러 에이전트가 서로의 시연에서 학습하는 다중 에이전트 시스템에 견습 학습을 사용하는 것에 대한 관심이 증가하고 있습니다. 이는 차량이 서로 상호 작용해야 하는 자율 주행에서 특히 관련이 있습니다. MIT CSAIL 및 Stanford AI Lab과 같은 기관의 연구는 확장성과 견고성에 초점을 맞춰 이러한 방향을 탐구했습니다.
미래 방향
견습 학습의 미래는 현재의 한계를 해결하는 데 있습니다. 유망한 방향 중 하나는 사전 지식을 활용하거나 불확실한 상태에서 추가 시연을 위해 전문가에게 질의하는 능동 학습을 사용하여 더 적은 시연을 요구하는 방법의 개발입니다. 또 다른 방향은 에이전트가 관찰에서 숨겨진 상태를 추론해야 하는 부분 관찰 가능 환경으로의 확장입니다. 이는 센서가 노이즈가 많고 불완전한 정보를 제공하는 로봇 공학 및 자율 주행과 같은 실제 응용 분야에 중요합니다.
또한 모델 가지치기 및 데이터 증강과 같은 다른 형태의 학습과 견습 학습을 결합하여 효율성과 일반화를 개선하는 작업이 진행 중입니다. AI 시스템이 사회에 더 통합됨에 따라 견습 학습은 기계가 인간 전문 지식에서 안전하고 신뢰할 수 있는 방식으로 학습할 수 있게 하는 데 핵심적인 역할을 할 가능성이 높습니다.