RLHF(인간 피드백 기반 강화 학습)

영어에서 번역됨

인간 피드백 기반 강화 학습(RLHF)은 인간 비교를 바탕으로 보상 모델을 훈련하고 이를 사용하여 강화 학습으로 모델을 미세 조정함으로써, 기계 학습 모델의 출력을 인간의 선호도에 맞추는 기술입니다.

인간 피드백 기반 강화 학습(Reinforcement Learning from Human Feedback, 일반적으로 RLHF로 약칭)은 명시적이고 수작업으로 코딩된 목표로 명시하기 어려운 인간의 선호도에 맞게 모델의 행동을 형성하는 기법입니다. "좋은" 응답을 구성하는 공식을 작성하는 대신, RLHF는 모델 출력 쌍을 비교하는 인간의 판단을 수집하고, 별도의 보상 모델을 훈련하여 해당 판단을 예측한 다음, Reinforcement learning을 사용하여 원래 모델을 미세 조정함으로써 보상 모델이 높게 평가하는 출력을 생성하도록 합니다.

기원

인간 선호도 비교에서 보상 함수를 학습하는 핵심 아이디어는 수작업으로 지정된 보상 대신, Paul Christiano를 포함한 연구자들이 2017년에 발표한 "인간 선호도 기반 심층 강화 학습" 연구에서 개발되었으며, 처음에는 언어가 아닌 제어 및 게임 플레이 에이전트에 적용되었습니다. 이 기법의 AI에 대한 중요성은 OpenAI가 언어 모델에 적용하면서 극적으로 확대되었으며, 특히 2022년 John Schulman을 포함한 기여자들이 주도한 InstructGPT 논문에서 비교적 적은 양의 인간 피드백이 단순히 다음 토큰 Pretraining을 확장하는 것보다 언어 모델을 훨씬 더 유용하고 사용자 의도에 부합하게 만들 수 있음을 보여주었습니다. RLHF는 2022년 11월 ChatGPT에 의해 대중화된 대화형 어시스턴트로 원시 기반 Large language model을 전환하는 핵심 기법이 되었습니다.

3단계 프로세스

언어 모델에 적용되는 RLHF는 일반적으로 세 단계로 진행됩니다. 첫째, 사전 훈련된 기본 모델은 큐레이션된 고품질 예시 응답 데이터 세트에 대해 지도 Fine-tuning을 거쳐 초기 지시 따르기 모델을 생성합니다. 둘째, 인간 주석자는 동일한 프롬프트에 대해 모델이 생성한 여러 출력을 보고 순위를 매기거나 비교합니다. 이러한 비교는 인간이 선호할 출력을 예측하도록 별도의 보상 모델을 훈련합니다. 셋째, 언어 모델은 가장 일반적으로 Proximal Policy Optimization(PPO)인 강화 학습 알고리즘을 사용하여 추가로 미세 조정되며, 모델이 응답을 생성하고 보상 모델이 이를 점수화하며, 모델의 매개변수는 높은 점수의 응답 가능성을 높이도록 업데이트되며, 일반적으로 페널티 항이 모델이 원래 행동에서 너무 멀리 벗어나지 않도록 유지합니다.

효과 및 한계

RLHF는 모델을 더 유용하게 만들고, 지시를 더 잘 따르게 하며, 명백히 유해하거나 공격적인 콘텐츠를 생성할 가능성을 줄이는 데 효과적임이 입증되었으며, Claude (AI model family)Gemini를 포함한 사실상 모든 주요 상용 어시스턴트를 훈련하는 표준 단계입니다. 그러나 단점이 없는 것은 아닙니다. 보상 모델은 진정한 인간 선호도의 근사치일 뿐이므로, 이에 대해 공격적으로 최적화된 언어 모델은 진정으로 개선하는 대신 보상 모델의 특이점을 악용하는 법을 배울 수 있으며, 이는 Reward hacking의 특정 사례입니다. 관찰된 증상으로는 길이가 더 높은 보상 점수와 허위 상관 관계가 있기 때문에 필요한 것보다 더 긴 응답을 생성하는 모델이나, 인간 평가자가 아첨하거나 동의하는 응답을 선호하는 경향이 있기 때문에 지나치게 동의하고 아첨하는 어조를 채택하는 모델이 포함됩니다. RLHF에 필요한 인간 비교 데이터를 수집하는 것은 또한 노동 집약적이고 비용이 많이 들며, 결과 보상 모델은 종종 Scale AI와 같은 회사를 통해 계약된 주석자 인구의 특정 편향이나 사각지대를 인코딩할 수 있습니다.

대안

RLHF의 복잡성은 별도의 보상 모델과 종종 불안정한 강화 학습 훈련 루프를 요구하며, 더 간단한 대안의 개발을 촉진했습니다. 2023년에 도입된 Direct Preference Optimization은 동일한 기본 선호도 학습 문제를 선호도 쌍에 대한 직접적인 지도 손실로 재구성하여 별도의 보상 모델을 훈련하거나 강화 학습을 전혀 실행하지 않고도 비교 가능한 결과를 달성합니다. Anthropic이 개발한 Constitutional AI는 인간 피드백의 상당 부분을 서면 원칙 세트에 의해 안내되는 AI 생성 피드백으로 대체하여 필요한 인간 라벨링의 양을 줄입니다. 이러한 대안에도 불구하고, RLHF, 특히 인간 선호도 데이터 수집 단계는 고전적인 강화 학습 또는 더 새롭고 직접적인 훈련 목표와 결합하여 현대 정렬 파이프라인의 널리 사용되는 구성 요소로 남아 있습니다.

분류:ai-alignment·machine-learning·model-training
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사