GPT-NeoX는 연구 집단 EleutherAI가 개발한 오픈소스 대규모 언어 모델이다. 2022년 2월에 출시된 이 모델은 200억 개의 매개변수를 가진 자기회귀 트랜스포머 모델로, 출시 당시 완전히 오픈소스로 공개된 가장 큰 언어 모델 중 하나였다. 이 모델은 가중치, 학습 코드, 평가 세부 사항을 자유롭게 제공함으로써 독점 시스템에 대한 공개적으로 접근 가능한 대안을 제공하여 인공지능 연구를 발전시키기 위해 설계되었다. GPT-NeoX는 이전 GPT-Neo 시리즈를 기반으로 하여, 다양한 자연어 작업에서 성능을 향상시키기 위해 아키텍처와 학습 기법을 확장했다.
이 모델의 아키텍처는 표준 디코더 전용 트랜스포머 설계를 따르며, 다중 헤드 어텐션과 위치 인코딩, 층 정규화를 통합한다. 44개 층의 스택 전체에 잔차 네트워크 연결을 사용하며, 은닉 차원은 6144, 어텐션 헤드는 32개이다. 이 모델은 웹 크롤링, 도서, 학술 논문에서 수집된 다양한 텍스트 말뭉치로 학습되었으며, 총 약 825기가바이트의 데이터로 구성된다. 학습은 Megatron-DeepSpeed 프레임워크를 사용하여 96개의 NVIDIA A100 GPU 클러스터에서 수행되었으며, 이를 통해 효율적인 모델 가지치기와 여러 노드 간 병렬화가 가능했다. 학습 과정은 약 2개월이 걸렸으며, 추정 1.1엑사플롭스의 연산을 소비했다.
학습 및 최적화
GPT-NeoX는 대규모 학습을 안정화하기 위해 여러 고급 기계 학습 기법을 사용했다. 이 모델은 기울기 폭주를 방지하기 위해 기울기 클리핑을 사용했고, 워밍업 단계와 코사인 감쇠를 따르는 학습률 스케줄을 채택했다. 가중치 초기화는 이전 트랜스포머 모델의 관행을 따라 스케일된 분산을 가진 정규 분포로 수행되었다. 학습 목표는 표준 인과 언어 모델링으로, 이전 맥락이 주어졌을 때 다음 토큰을 예측하는 것이었다. 효율성을 높이기 위해 팀은 시퀀스-투-시퀀스 배칭을 구현했고, 매개변수 업데이트에 Adam 옵티마이저와 SGD 변형을 사용했다. 모델은 또한 정규화를 위해 드롭아웃을 통합했지만, 용량을 보존하기 위해 더 작은 모델보다 낮은 비율로 적용했다.
능력 및 성능
GPT-NeoX는 LAMBADA, HellaSwag, SuperGLUE와 같은 벤치마크에서 강력한 성능을 보여주며, 완전히 공개되지 않은 유사한 크기의 모델과 자주 경쟁하거나 능가한다. 이 모델은 이야기 생성과 개방형 질문 응답과 같은 장거리 의존성이 필요한 딥러닝 작업에서 뛰어나다. 또한 제어된 텍스트 생성을 위해 top-k 샘플링, top-p 샘플링, 온도 스케일링을 지원하여 사용자가 창의성과 결정성을 조정할 수 있게 한다. 200억 개의 매개변수 규모는 미묘한 신경망 표현을 가능하게 하지만, 추론에 상당한 계산 자원이 필요하며 일반적으로 여러 고성능 GPU가 필요하다. 이 모델은 1.3B 및 2.7B 변형을 포함한 여러 크기로 제공되지만, 20B 버전이 주력 모델이다.
영향 및 생태계
GPT-NeoX는 오픈소스 생성형 AI 커뮤니티에 상당한 영향을 미쳤다. 이 모델은 GPT-J 및 GPT-NeoX-20B 파생 모델을 포함한 후속 모델의 기반이 되었으며, 다른 조직이 대규모 오픈 모델을 출시하도록 영감을 주었다. 학습 코드와 인프라는 널리 재사용되어 EleutherAI 평가 하네스와 같은 도구 개발에 기여했다. 이 모델의 출시는 또한 대규모 모델 학습의 환경 비용과 AI 연구에서 투명성의 중요성에 대한 논의를 촉발했다. 이 모델은 OpenAI와 Anthropic의 독점 모델과 자주 비교되지만, 그들의 가장 큰 제공 모델보다는 여전히 작다.
한계 및 윤리적 고려 사항
많은 대규모 언어 모델과 마찬가지로 GPT-NeoX는 학습 데이터에 존재하는 편향을 반영하여 편향되거나 유해한 콘텐츠를 생성할 수 있다. 이 모델에는 내장된 안전 필터가 없으며, 사용자는 추가적인 조정을 적용하는 것이 권장된다. 모델의 크기는 소비자 하드웨어에서 배포하기에 비현실적으로 만들어, 자금이 충분한 기관에 대한 접근을 제한한다. EleutherAI는 이 모델이 연구 산출물이지 생산 시스템이 아니라고 강조하며 책임 있는 사용을 권장한다. 학습 데이터에는 저작권이 있는 자료가 포함되어 공정 사용에 대한 법적 질문을 제기하지만, 모델은 Apache 2.0 라이선스로 출시되어 광범위한 다운스트림 사용을 허용한다.
가용성 및 사용
GPT-NeoX는 Hugging Face와 EleutherAI GitHub 저장소에서 다운로드할 수 있다. 이 모델은 Transformers 라이브러리 또는 원래 Megatron-DeepSpeed 코드베이스를 사용하여 실행할 수 있다. 개발자에게는 성능과 접근성 사이의 균형을 제공하며, 커뮤니티에서 만든 양자화 버전이 메모리 요구 사항을 줄여준다. 이 모델은 해석 가능성, 커리큘럼 학습, RLHF에 대한 학술 연구에 사용되었으며, 새로운 아키텍처를 평가하기 위한 기준선 역할을 한다. 개방적인 특성 덕분에 전문 분야에 대한 미세 조정이 가능하여 기계 학습 실무자에게 다재다능한 도구가 된다.