InstructGPT-175B는 OpenAI가 개발한 대규모 언어 모델로, InstructGPT 계열에서 가장 큰 구성에 해당한다. 이는 GPT-3 아키텍처의 변형으로, 특히 175B 매개변수 버전이며, 인간 피드백으로부터의 강화 학습(RLHF)이라는 기법을 사용하여 미세 조정되었다. 이 모델은 이전 GPT-3 모델의 한계를 해결하기 위해 설계되었는데, 기존 모델은 종종 진실되지 않거나 유해하거나 사용자 의도와 잘 맞지 않는 출력을 생성했다. InstructGPT-175B는 2022년 초에 발표된 연구 논문에서 소개되었으며, 동일한 크기의 기본 GPT-3 모델인 전작에 비해 지시 수행 및 유용성에서 상당한 개선을 보여주었다.
InstructGPT-175B의 개발은 생성형 인공지능 분야에서 중대한 전환점을 마련했는데, 이는 RLHF를 대규모 언어 모델을 인간 선호도에 맞추는 핵심 훈련 패러다임으로 확립했기 때문이다. 모델의 훈련 과정은 세 단계로 구성되었다: 인간이 작성한 시연에 대한 지도 미세 조정, 인간 비교에 대한 보상 모델 훈련, 그리고 근접 정책 최적화(PPO)를 사용한 강화 학습 최적화. 이 접근 방식은 동일한 아키텍처와 매개변수 수를 가졌음에도 불구하고, 모델이 원래 GPT-3보다 인간 평가자들이 선호하는 응답을 생성할 수 있게 했다.
훈련 방법론
InstructGPT-175B는 인간 라벨러로부터 수집된 프롬프트와 원하는 출력의 데이터셋을 사용하여 훈련되었다. 초기 지도 미세 조정 단계에서는 약 13,000개의 훈련 프롬프트가 사용되었으며, 라벨러가 시연 응답을 작성했다. 이후 보상 모델은 약 33,000개의 비교 데이터셋으로 훈련되었는데, 라벨러는 동일한 프롬프트에 대한 다양한 모델 출력을 순위화했다. 마지막 강화 학습 단계에서는 보상 모델을 사용하여 정책을 최적화했으며, 175B 모델은 훈련된 여러 크기(1.3B, 6.7B, 13B 변형 포함) 중 가장 큰 것이었다. 훈련에는 Adam 옵티마이저가 학습률 스케줄과 그래디언트 클리핑과 함께 사용되어 안정성을 보장했다.
평가 및 결과
인간 평가자들은 대부분의 프롬프트 범주에서 GPT-3 175B 출력보다 InstructGPT-175B 출력을 일관되게 선호했으며, 선호율은 70%를 초과했다. 모델은 환각 감소, 명시적 지시 따르기, 유해하거나 편향된 언어 회피에서 특히 개선을 보였다. 그러나 평가는 또한 InstructGPT-175B가 특정 적대적 프롬프트에 여전히 취약하며, 모호한 주제에 대해 질문받을 때 잘못된 정보를 생성할 수 있음을 드러냈다. 표준 NLP 벤치마크에서의 모델 성능은 일반적으로 GPT-3와 비슷했지만, 사용자 요구에 대한 더 나은 정렬 덕분에 실제 세계에서의 유용성은 훨씬 높았다.
영향 및 유산
InstructGPT-175B의 성공은 ChatGPT 시리즈를 포함한 OpenAI의 이후 모델 개발에 영향을 주었으며, 이 시리즈는 유사한 RLHF 기법을 채택했다. 또한 Anthropic 및 Google DeepMind와 같은 다른 조직들이 자체 훈련 파이프라인에 인간 피드백을 통합하도록 영감을 주었다. 이 모델은 확장만으로는 유용한 AI 시스템을 만드는 데 충분하지 않으며, 정렬 기법이 실제 배포에 필수적임을 입증했다. InstructGPT-175B는 종종 AI 정렬 분야의 기초 작업으로 인용되며, 그 방법론은 LLaMA 및 Claude와 같은 이후 모델의 표준 참조가 되었다.
한계 및 윤리적 고려 사항
개선에도 불구하고 InstructGPT-175B는 주목할 만한 한계가 있었다. 과도하게 장황할 수 있고, 때로는 정보를 반복하며, 모호한 프롬프트에 대해 명확한 질문을 하지 못하는 경우가 있었다. 모델은 또한 훈련 데이터에 존재하는 편향을 나타냈으며, RLHF는 유해한 출력을 완전히 제거하지 못했다. OpenAI는 모델을 API를 통해 출시했지만, 오용을 완화하기 위해 접근을 제한했다. 모델에 수반된 연구 논문은 이러한 한계를 공개적으로 논의하며, 견고성, 해석 가능성 및 안전성에 대한 지속적인 작업의 필요성을 강조했다. 이러한 논의는 책임 있는 AI 개발과 대규모 언어 모델을 대규모로 배포하는 윤리적 영향에 대한 더 넓은 대화에 기여했다.
기술 사양
InstructGPT-175B는 GPT-3와 동일한 트랜스포머 아키텍처를 사용하며, 96개 레이어, 96개 어텐션 헤드, 12,288의 히든 크기를 가진다. 멀티 헤드 어텐션과 레이어 정규화를 사용하며, 컨텍스트 창은 2048 토큰이다. 모델은 웹 텍스트, 책 및 기타 소스의 혼합으로 훈련되었으며, 미세 조정 과정은 기본 아키텍처를 변경하지 않았다. 175B 매개변수 수는 당시 가장 큰 모델 중 하나로 만들었으며, 훈련과 추론 모두에 상당한 계산 자원이 필요했다. OpenAI는 정확한 훈련 계산량을 공개하지 않았지만, 추정에 따르면 NVIDIA 하드웨어에서 수천 GPU-일이 포함되었다.
결론
InstructGPT-175B는 대규모 언어 모델을 인간 의도에 맞추는 데 있어 획기적인 성과를 나타낸다. 그 개발은 RLHF의 효과를 입증했으며, AI 시스템의 유용성과 안전성에 대한 새로운 기준을 세웠다. 더 새로운 모델들이 능력에서 이를 능가했지만, 그 영향은 현대 지시 조정 모델의 설계에 지속되고 있다. 모델의 유산은 AI 산업 전반에 걸친 인간 피드백 기법의 광범위한 채택에서 분명하며, 이는 현대 머신 러닝 연구와 응용의 초석이 되었다.
참고 문헌
이 문서의 주요 출처는 OpenAI 연구 논문 "Training language models to follow instructions with human feedback"(2022)이며, 저자는 Long Ouyang, Jeff Wu, Xu Jiang 및 동료들이다. 추가 정보는 AI 커뮤니티의 후속 분석 및 리뷰에서 가져왔다.
같이 보기
분류
- large-language-models
- OpenAI
- Reinforcement learning
- AI Alignment